Q*bert: Evolutionsalgorithmus entdeckt Spielfehler mit Millionen-Score

Eine Forschungsarbeit der Universität Freiburg zeigt, wie ein evolutionärer Algorithmus beim Training auf Atari-Spielen unerwartete Wege zum hohen Punktestand findet. Die am 24. Februar 2018 veröffentlichte Studie „Back to Basics: Benchmarking Canonical Evolution Strategies for Playing Atari“ vergleicht eine einfache Variante evolutionärer Strategien mit Verfahren des bestärkenden Lernens.

Nach fünf Stunden Training entdeckte der Algorithmus in Q*bert zwei ungewöhnliche Strategien. In einem Lauf lockte der Agent einen Gegner zum Rand, sprang selbst von der Plattform und erhielt durch das Ausschalten des Gegners genügend Punkte für ein weiteres Leben. In einem zweiten Lauf beendete er zunächst die erste Ebene. Danach wechselten die Plattformen in einen blinkenden Zustand, die nächste Runde startete nicht und der Punktestand stieg innerhalb des begrenzten Durchlaufs auf beinahe eine Million. Ein Video der Q*bert-Strategie dokumentiert diesen Ablauf.

https://www.youtube.com/watch?v=meE5aaRJ0Zs

Der Score war wichtiger als das Spielziel

Die Studie bewertet keine menschliche Spielweise, sondern optimiert die gemessene Belohnung. Dadurch konnte das Verfahren Lösungen finden, die das Punktesystem ausnutzten, ohne die nächste Ebene zu erreichen. Beim Plattformfehler gelang das nicht zuverlässig: 22 von 30 Testläufen mit denselben Netzwerkgewichten blieben wegen unterschiedlicher Startbedingungen bei einem niedrigen Punktestand.

Getestet wurde eine einfache Canonical Evolution Strategy auf acht Atari-Spielen. Die Autoren sehen darin eine konkurrenzfähige Alternative zu komplexeren Verfahren, betonen aber auch die hohe Streuung einzelner Läufe. Solche Ergebnisse sind für die Entwicklung und Qualitätssicherung interaktiver Systeme interessant, weil automatisierte Tests nicht nur erwartete Spielzüge prüfen, sondern auch unerwartete Zustände und Schwachstellen finden können. Einen früheren Blick auf lernende Spielgegner gab es bereits bei Deep-Learning-Experimenten mit Doom.

Weitere News

Weitere News

Kommentieren Sie den Artikel

Bitte geben Sie Ihren Kommentar ein!
Bitte geben Sie hier Ihren Namen ein