Ein Forschungsteam von DeepMind hat Agenten für den Mehrspieler-Shooter Quake III Arena trainiert. Das am 3. Juli 2018 veröffentlichte Forschungspapier beschreibt ein Verfahren, mit dem die künstlichen Spieler im Capture the Flag ein menschliches Leistungsniveau erreichten.
Die Agenten erhielten keine vorgegebenen Regeln für das Verhalten. Sie beobachteten Bilddaten aus dem Spiel und steuerten die Spielfigur über eine emulierte Eingabe. Als Rückmeldung diente zunächst nur die Information, ob das eigene Team die Runde gewonnen hatte.
Populationen lernen Zusammenarbeit
DeepMind trainierte nicht nur einen einzelnen Agenten. Mehrere Varianten spielten gegeneinander und miteinander, wodurch unterschiedliche Spielweisen und Gegenstrategien entstanden. Zusätzlich lernte jeder Agent ein internes Belohnungssignal, das Zwischenziele wie das Erobern der Flagge abbildete.
Capture the Flag stellte dabei andere Anforderungen als ein Einzelspieler-Test. Die Agenten mussten mit wechselnden Teammitgliedern kooperieren, Gegner verfolgen und gleichzeitig die eigene Basis schützen. Die Forschungsarbeit untersuchte außerdem Varianten mit verzögerter Reaktion, um den Vorteil extrem schneller Eingaben zu begrenzen.
Die Ergebnisse knüpften an frühere Arbeiten zu KI-Forschung in Spielen an, verschoben den Schwerpunkt aber auf Echtzeitentscheidungen in einem dreidimensionalen Mehrspielerfeld. Für die Spieleentwicklung ist dabei besonders interessant, dass die Trainingsumgebung nicht nur einzelne Aktionen, sondern taktische Zusammenarbeit bewertete.

