AlphaStar, l'IA de DeepMind qui a battu deux des meilleurs joueurs de Starcraft II,

A-t-elle combattu à la loyale ou disposait-elle d'avantages ?

Le 4 février 2019 à 16:04, par Stéphane le calme

294PARTAGES

AlphaStar, l'IA de DeepMind qui a battu deux des meilleurs joueurs de Starcraft II,
a eu "jusqu'à" 200 ans d'entraînements en gameplay virtuel

DeepMind, la startup de l'IA acquise par Google en 2014, est probablement mieux connue pour avoir créé la première intelligence artificielle à battre un champion du monde au jeu de Go. Alors, que faites-vous après avoir maîtrisé l'un des jeux de société les plus difficiles au monde ? Vous abordez un jeu vidéo complexe. Plus précisément, DeepMind a décidé de développer une IA pour jouer au jeu de stratégie en temps réel StarCraft II.

StarCraft exige des joueurs qu’ils rassemblent des ressources, construisent des dizaines d’unités militaires et les utilisent pour tenter de détruire leurs adversaires. StarCraft est particulièrement difficile pour une IA car les joueurs doivent exécuter des plans à long terme sur plusieurs minutes de jeu, les peaufinant à la volée face aux contre-attaques ennemies. DeepMind a déclaré qu’avant ses propres efforts, personne n’était parvenu à concevoir une intelligence artificielle StarCraft aussi performante que les meilleurs joueurs.

La nécessité d'équilibrer les objectifs à court et à long terme et de s'adapter aux situations imprévues pose un défi de taille aux systèmes souvent fragiles et inflexibles. La maîtrise de ce problème nécessite des avancées dans plusieurs défis de la recherche sur l'IA, notamment dans :

la théorie du jeu : StarCraft est un jeu où, à la différence du chifoumi (pierre-papier-ciseaux, il n'y a pas de meilleure stratégie. En tant que tel, un processus de formation à l'IA doit continuellement explorer et élargir les frontières de la connaissance stratégique.
Informations imparfaites : contrairement aux jeux comme les échecs ou Go où les joueurs voient tout, les informations cruciales sont cachées aux joueurs de StarCraft et doivent être activement découvertes en effectuant des « reconnaissances ».
Planification à long terme : comme beaucoup de problèmes concrets, les causes et effets ne sont pas instantanés. Les jeux peuvent également prendre jusqu’à une heure, ce qui signifie que les actions entreprises au début du jeu risquent de ne pas être rentables avant longtemps.
Temps réel : contrairement aux jeux de société traditionnels où les joueurs alternent les mouvements subséquents, les joueurs de StarCraft doivent effectuer des actions de manière continue au fur et à mesure que le chronomètre avance.
Grand espace d'action : des centaines d'unités et de bâtiments différents doivent être contrôlés simultanément, en temps réel, créant ainsi un espace combinatoire de possibilités. De plus, les actions sont hiérarchiques et peuvent être modifiées et augmentées.

En raison de ces immenses défis, StarCraft est devenu un « grand défi » pour la recherche sur l'IA.

DeepMind a annoncé avoir battu deux des meilleurs joueurs de StarCraft

Jeudi dernier, DeepMind a annoncé une avancée significative. La société a opposé son IA, baptisée AlphaStar, à deux des meilleurs joueurs de StarCraft - Dario "TLO" Wünsch et Grzegorz "MaNa" Komincz. AlphaStar a remporté une série de cinq matchs contre Wünsch 5-0, puis a battu Komincz 5-0.

Envoyé par DeepMind

Ces dernières années, StarCraft, considéré comme l'un des jeux de stratégie en temps réel (RTS) les plus difficiles et l'un des sports les plus joués de tous les temps, s'est imposé par consensus comme un « grand défi » pour la recherche sur l'IA.

Nous présentons maintenant notre programme StarCraft II, AlphaStar, la première intelligence artificielle à vaincre un joueur professionnel de haut niveau. Lors d'une série de matches d'essai qui s'est déroulée le 19 décembre, AlphaStar a remporté une victoire décisive face au Grzegorz "MaNa" Komincz, de l'équipe Liquid, 5-0, à la suite d'un match de référence contre son coéquipier Dario "TLO" Wünsch. . Les matches se sont déroulés dans des conditions de match professionnelles sur une carte en échelle de compétition et sans aucune restriction de jeu.

Bien que les jeux vidéo tels qu'Atari, Mario, Quake III Arena Capture du drapeau et Dota 2 aient connu un succès considérable, les techniques de l'intelligence artificielle ont jusqu'à présent eu du mal à faire face à la complexité de StarCraft. Les meilleurs résultats ont été rendus possibles par la fabrication manuelle d’éléments majeurs du système, l’imposition de restrictions importantes aux règles du jeu, la fourniture de capacités surhumaines au système ou la lecture de cartes simplifiées. Même avec ces modifications, aucun système n’a réussi à rivaliser avec les compétences des joueurs professionnels. En revanche, AlphaStar joue à StarCraft II dans son intégralité, en utilisant un réseau de neurones profonds entraîné directement à partir de données brutes de jeu, par apprentissage supervisé et renforcement.

AlphaStar a été formé en utilisant "jusqu'à 200 ans" de gameplay virtuel

Le comportement d’AlphaStar est généré par un réseau de neurones profonds qui reçoit des données d’entrée de l’interface de jeu brute (une liste des unités et de leurs propriétés) et émet une séquence d’instructions constituant une action dans le jeu.

AlphaStar utilise également un nouvel algorithme d’apprentissage multi-agents. Le réseau de neurones a été initialement formé par apprentissage supervisé à partir de jeux humains anonymisés publiés par Blizzard. Cela a permis à AlphaStar d’apprendre, par imitation, les stratégies de base micro et macro utilisées par les joueurs à l’échelle de StarCraft. Cet agent initial a vaincu l'IA intégrée de niveau « Elite » - autour du niveau de l'or pour un joueur humain - dans 95% des matchs.

Envoyé par DeepMind

Afin de former AlphaStar, nous avons développé une configuration de formation distribuée hautement évolutive à l'aide des TPU v3 de Google, qui prend en charge une population d'agents apprenant à partir de plusieurs milliers d'instances parallèles de StarCraft II. La ligue AlphaStar a duré 14 jours, avec 16 TPU pour chaque agent. Pendant la formation, chaque agent a connu jusqu'à 200 ans de jeu StarCraft en temps réel. L'agent final AlphaStar comprend les composants de la distribution Nash de la ligue - en d'autres termes, le mélange le plus efficace de stratégies découvertes - fonctionnant sur un seul GPU desktop.

En somme, le processus a commencé par l'utilisation de l'apprentissage supervisé pour aider les agents à apprendre à imiter les stratégies des joueurs humains. Cette technique d’apprentissage par renforcement était suffisante pour construire un bot StarCraft II compétent. DeepMind dit que cet agent initial « a vaincu l'IA intégrée du niveau Elite - autour du niveau de l'or pour un joueur humain - dans 95% des matchs »

DeepMind a ensuite divisé cette IA initiale en plusieurs variantes, chacune avec un style de jeu légèrement différent. Tous ces agents ont été jetés dans une ligue virtuelle StarCraft, chaque agent jouant avec les autres joueurs 24 heures sur 24, apprenant de leurs erreurs et faisant évoluer leurs stratégies au fil du temps.

« Pour encourager la diversité dans la ligue, chaque agent a son propre objectif d'apprentissage: par exemple, quels concurrents cet agent devrait-il viser, et toutes motivations internes supplémentaires qui biaisent la façon dont l'agent joue », explique DeepMind. « Un agent peut avoir pour objectif de vaincre un concurrent spécifique, tandis qu'un autre peut devoir vaincre toute une distribution de concurrents, mais en construisant davantage d'une unité de jeu particulière ».

Selon DeepMind, certains agents ont gagné l'équivalent de 200 ans de pratique en jouant à StarCraft contre d'autres agents. Sur une période de deux semaines, ce processus darwinien a considérablement amélioré les compétences moyennes des agents:

Au terme de ce processus, DeepMind a sélectionné cinq des agents les plus puissants de sa ménagerie virtuelle pour affronter les challengers humains d'AlphaStar. Une conséquence de cette approche est que les joueurs humains été confrontés à une stratégie différente lors de chaque match contre AlphaStar.

Source : DeepMind

Et vous ?

Le combat était-il équitable selon vous ou l'IA disposait-elle d'avantages ?

Voir aussi :

Unity lancera bientôt un challenge axé sur l'intelligence artificielle au travers d'un jeu pour repousser les limites des systèmes intelligents

La révolution de l'automatisation et de l'intelligence artificielle sera surtout néfaste pour les hommes, selon une analyse

« L'intelligence artificielle n'existe pas et la voiture autonome n'existera jamais », selon un expert en IA

RITME organise un atelier sur la programmation parallèle et l'intelligence artificielle, les 6 et 7 février 2019 en Belgique

Dans l'hôtel futuriste d'Alibaba, le personnel est en supplément, l'hôtel étant géré par l'intelligence artificielle

Vous avez lu gratuitement 1 915 articles depuis plus d'un an.
Soutenez le club developpez.com en souscrivant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !

Votre nom : Votre e-mail :

Décrivez l'erreur que vous souhaitez porter à notre connaissance :

Identifiez-vous

Créer un compte

AlphaStar, l'IA de DeepMind qui a battu deux des meilleurs joueurs de Starcraft II,

A-t-elle combattu à la loyale ou disposait-elle d'avantages ?

Identifiant
Mot de passe

Mot de passe oublié ?

Identifiez-vous

Créer un compte

AlphaStar, l'IA de DeepMind qui a battu deux des meilleurs joueurs de Starcraft II, A-t-elle combattu à la loyale ou disposait-elle d'avantages ?

AlphaStar, l'IA de DeepMind qui a battu deux des meilleurs joueurs de Starcraft II,

A-t-elle combattu à la loyale ou disposait-elle d'avantages ?