AlphaStar от Google DeepMind: как нейросети запомнить все алгоритмы

AlphaStar от Google DeepMind: как нейросети запомнить все алгоритмы

Команда Google DeepMind вместе со своим партнером Blizzard Entertainment разработала нейросеть, которая способна играть в стратегическую игру StarCraft II. Уже на начальных этапах, как пишут в материале создатели алгоритма, эта работа казалась им вызовом. StarCraft II – «идеальная среда для исследований в области искусственного интеллекта», – говорят они, называя среди трудностей многозадачность, которой должен обладать игрок. Например, при наличии главной цели – победы над противником – пользователь также должен выполнять ряд подцелей, таких как сбор ресурсов или строительство сооружений.

Скриншот: один из матчей по игре StarCraft II
Скриншот: один из матчей по игре StarCraft II

AlphaStar называют первой нейросетью, способной обыграть профессионалов в StarCraft. Авторы статьи на сайте «Хабр» объясняют, что ранее создатели других алгоритмом вручную конструировали основные элементы игрового процесса, накладывали ограничения на правила, чтобы упростить путь к победе для искусственного интеллекта, предоставляли системе «сверхчеловеческие способности». Вместо этого разработчики AlphaStar сделали так, чтобы нейросеть играла «в полноценную игру», без упрощений, и именно это позволило ей начать выигрывать. 

«Я немного беспокоюсь, потому что ИИ, побеждающий лучших игроков в мире, всегда захватывает, но в то же время это может нанести ущерб соревнованиям или сообществу: есть что-то лучше, чем лучшие игроки», — сказал в интервью порталу ESPN польский профессиональный игрок в StarCraft II Артур «Нерчио» Блох. 

Вюнш был членом национальной команды Германии — Team Germany. Изначально играл в StarCraft II под псевдонимом TheLittleOne, но поклонники сократили его до TLO.
Вюнш был членом национальной команды Германии — Team Germany. Изначально играл в StarCraft II под псевдонимом TheLittleOne, но поклонники сократили его до TLO.

В декабре 2018 года AlphaStar успешно обыграла опытных участников турниров StarCraft II: TLO (Дарио Вюнш из Германии) и MaNa (Гжегож Коминц из Польши). Нейросеть продемонстрировав уровень игры, сопоставимый с лучшими игроками мира и использовала сложные тактики, включая агрессивные атаки, которые были ранее недоступны для ИИ. Например, в одном из матчей AlphaStar применила стратегию «блиц», что позволило ей быстро захватить инициативу. В итоге алгоритм одержал 10 побед (поражений не было). Как подчеркивают авторы материала, благодаря обучению AlphaStar, TLO «не смог приспособиться к стилю ее игры». Сначала нейросеть просматривала записи игр в течение трех суток, затем играла сама с собой, оттачивая навыки. AlphaStar использовала имитационное обучение, и это помогло ей адаптироваться к различным стратегиям и стилям игры

На портале «Tproger» также обсуждались сложности игры в StarCraft. По мнению авторов материала, «это эталон»: поединки проводятся с 1990-х годов, а уровень киберспортсменов продолжает расти и сейчас. Жанр «стратегии в реальном времени» заставляет алгоритм предугадывать действия других игроков, и долгая история StarCraft умножает количество возможных ходов в несколько раз. Например, такие игры, как го и шахматы, можно назвать идеальными информационными играми: искусственный интеллект видит все ходы противников и рассчитывает различные исходы (на игровой доске «количество действительных позиций равно 1, далее следуют 170 нулей»). Но в StarCraft II, сообщается на сайте «PCgamer», нужно будет добавить еще как минимум 100 нулей, чтобы учесть его сложность.

Кроме того, подчеркивают эксперты портала «Tproger», важна адекватная реакция нейросети на внеплановые ситуации. Возможно, после таких успехов в игровой сфере навыки искусственного интеллекта, связанные с риском, будут позже применять в реальной жизни (например, при оптимизации производственных процессов, логистике и даже в медицине), предполагают авторы материала. 

Скриншот: нейросеть AlphaStar играет в StarCraft II с одним из лучших пользователей MaNa
Скриншот: нейросеть AlphaStar играет в StarCraft II с одним из лучших пользователей MaNa

Разработчики нейросети компания DeepMind обратили внимание на то, что даже количество действий, технически возможных в StarCraft, достигает примерно 300 команд. Они сравнивают это число с играми Atari, в которых их всего около 10 (например, вверх, вниз, влево, вправо). В StarCraft команды иерархичны: в них доступны изменения и дополнения, «причем многие из них требуют точки на экране», то есть для них нужна свободная от других элементов зона. Разработчики приводят такие данные: даже если предположить небольшой размер экрана 84×84, доступно примерно 100 миллионов возможных действий.

Выяснилось, что, помимо способов обучения, которые упомянули эксперты из других источников, нейросеть AlphaStar также использовала серию простых мини-игр, которые позволяли исследователям проверять работу алгоритма при решении единичных задач. Разработчики даже создали документ, в котором полно описывается окружающая среда игрового процесса. Двигаясь от частного к общему, ИИ научился обыгрывать профессионалов, потому что «впитал» в себя огромный массив данных и научился им пользоваться на конкретных примерах.

LEAVE A REPLY