Перед матчем зритель активно использует экран для разных типов запросов. В одной вкладке фанат может изучать какие есть букмекеры c цупис, в другой у него идёт трансляция, а после игры открывается запись с разбором ключевых решений. OpenAI Five сделал такой разбор особенно интересным: действия команды определяли алгоритмы, которые не копировали профессиональные матчи, а учились в играх против собственных версий.
В шахматах система видит все фигуры и получает время на отдельный ход. В Dota 2 события развиваются непрерывно, противники могут исчезать в тумане войны, а ценность решения иногда становится понятна лишь через несколько минут.
Герою приходится выбирать направление движения, цель атаки, способность и момент её применения. Одновременно нужно учитывать здоровье союзников, положение соперников, состояние линий и доступные предметы. Один успешный эпизод ещё не гарантирует правильной стратегии: выигранная драка может обернуться потерей важных объектов на карте.
Поэтому OpenAI Five должен был связывать быстрые действия с далёкой целью. Для алгоритма это означало обучение на длинной последовательности событий, где награда за решение приходит не сразу.
OpenAI Five начинал с почти случайного поведения. Система не изучала архив профессиональных партий и не получала готовую библиотеку тактических схем. Её основной школой стала самоигра, при которой новые версии агентов встречались друг с другом и постепенно усиливали требования к сопернику.
Такой подход создаёт естественную лестницу сложности. Сначала алгоритм учится передвигаться, атаковать и использовать способности. Затем появляются более длинные связи: распределение героев по линиям, совместные выходы, борьба за пространство и выбор момента для атаки.
Чтобы команда не зацикливалась на одной удачной модели, часть тренировок проходила против более ранних версий. Старые соперники сохраняли стратегии, от которых новая система могла отказаться. Это помогало не забывать полезные решения и делало подготовку разнообразнее.
Каждым героем управляла отдельная нейронная сеть с памятью о предыдущих событиях. Прямого голосового канала между агентами не было. Координация возникала через общую задачу и устройство награды.
Разработчики регулировали соотношение личного и командного результата. На ранних этапах герой мог сильнее учитывать собственные ресурсы, а по мере обучения ценность общего успеха увеличивалась. Так система постепенно переходила от набора самостоятельных персонажей к связанной пятёрке.
На практике это выражалось в плотных совместных перемещениях, быстром выборе общей цели и готовности одного героя пожертвовать позицией ради команды. OpenAI Five не обсуждал план словами, но действия агентов складывались в узнаваемую тактику.
В основе проекта лежало обучение с подкреплением. Система совершала действие, получала положительный или отрицательный сигнал и корректировала своё поведение. Сам принцип не был новым, однако OpenAI Five показал, насколько сильно результат зависит от масштаба.
Тренировка продолжалась около десяти месяцев и включила десятки тысяч лет условного игрового опыта. Распределённая инфраструктура одновременно запускала множество партий, собирала данные и обновляла параметры моделей. Благодаря этому система могла за короткое реальное время пережить больше игровых ситуаций, чем человек встретил бы за всю карьеру.
Масштаб имел и обратную сторону. Такой подход требовал огромных вычислительных ресурсов и подходил прежде всего для цифровой среды, где новые партии можно создавать почти без ограничений. Перенести тот же объём проб и ошибок в физический спорт значительно сложнее.
В апреле 2019 года OpenAI Five выиграл две партии подряд у OG, действующего на тот момент чемпиона The International. Матч показал, что самообучающаяся система способна достигнуть профессионального уровня в сложной командной дисциплине.
Однако условия отличались от полного соревновательного режима Dota 2. Система использовала ограниченный набор героев и получала структурированные данные через программный интерфейс игры, а не распознавала изображение на мониторе. Она также обладала стабильной скоростью реакции и точностью исполнения, которые человеку трудно сохранять на протяжении всей карты.
Эти ограничения не обесценивают результат, но уточняют его смысл. OpenAI Five не решил Dota 2 целиком и не стал универсальным киберспортсменом. Проект доказал другое: при достаточном количестве тренировок алгоритм может самостоятельно обнаруживать долгосрочные планы, распределять командную награду и вырабатывать поведение, которое люди воспринимают как сыгранность.