AlphaZero: как работает, матчи со Stockfish и влияние на шахматы

Просмотры: 27397
AlphaZero: как работает, матчи со Stockfish и влияние на шахматы

В декабре 2017 года шахматный мир обсуждал необычный результат: исследовательская система AlphaZero, обучившаяся шахматам через игру с самой собой, выиграла тестовый матч у Stockfish 8. Её партии с ранними жертвами материала и долгосрочными атаками произвели огромное впечатление на гроссмейстеров и разработчиков шахматных программ.

Однако AlphaZero — не обычный шахматный движок, который можно скачать и установить. Это закрытая исследовательская система DeepMind, созданная для изучения универсального самообучающегося алгоритма.

Что такое AlphaZero?

AlphaZero — система искусственного интеллекта, разработанная компанией DeepMind, которая сегодня входит в Google DeepMind. Она создавалась не только для шахмат: один и тот же общий алгоритм обучался игре в шахматы, сёги и го.

В отличие от традиционных шахматных программ, AlphaZero начинала обучение без дебютной книги, эндшпильных таблиц и базы человеческих партий. В систему были заложены правила игры, после чего она совершенствовалась в миллионах партий с самой собой.

Логотип DeepMind — разработчика AlphaZero

AlphaZero была разработана исследовательской компанией DeepMind

Первый предварительный отчёт был опубликован в декабре 2017 года. Полное исследование, охватывающее шахматы, сёги и го, появилось в журнале Science в декабре 2018 года.

Название AlphaZero иногда используют как синоним нейросетевого шахматного движка, но это не совсем верно. AlphaZero была конкретной исследовательской системой. Доступные пользователям проекты, такие как Leela Chess Zero, лишь воспроизводят общие идеи самообучения и нейросетевого поиска.

Как AlphaZero обучалась шахматам?

AlphaZero использовала обучение с подкреплением. Система играла сама с собой, получала результат партии и постепенно корректировала параметры нейронной сети.

В начале обучение фактически начиналось со случайной игры. Со временем сеть училась распознавать полезные шахматные закономерности:

  • безопасность короля;
  • активность и взаимодействие фигур;
  • пешечные структуры;
  • долговременную компенсацию за материал;
  • типичные дебютные построения;
  • вероятность победы из конкретной позиции.

По данным DeepMind, в шахматах AlphaZero впервые превзошла тестируемый Stockfish примерно через четыре часа обучения. Полный тренировочный цикл для опубликованной версии занимал около девяти часов.

Нейронная сеть

Для каждой позиции нейронная сеть AlphaZero формировала два основных результата:

  • распределение вероятностей по возможным ходам;
  • оценку ожидаемого результата партии.

Сеть не просто присваивала позиции численное значение, но и подсказывала алгоритму, какие продолжения следует изучить в первую очередь.

Поиск по дереву Монте-Карло

Для выбора хода AlphaZero применяла поиск по дереву Монте-Карло — MCTS. Нейронная сеть направляла поиск к перспективным ветвям, поэтому системе не требовалось рассматривать столько же позиций, сколько традиционным движкам.

Сравнение поиска ходов AlphaZero и Stockfish

AlphaZero анализировала значительно меньше позиций, но тщательнее отбирала направления поиска

В исследовании 2018 года AlphaZero рассматривала около 60 тысяч позиций в секунду, тогда как Stockfish — примерно 60 миллионов. Эти числа нельзя использовать для прямого измерения силы: системы применяли разные архитектуры и по-разному расходовали вычислительные ресурсы.

Первый матч AlphaZero против Stockfish

В декабре 2017 года DeepMind сообщила о предварительном эксперименте с участием AlphaZero и Stockfish 8.

В матче из 100 партий AlphaZero показала результат:

28 побед, 72 ничьи и 0 поражений

Контроль времени составлял одну минуту на ход. В опубликованной конфигурации Stockfish играл без дебютной книги и без эндшпильных таблиц.

Результат вызвал огромный интерес, но одновременно и вопросы к условиям сравнения. У AlphaZero и Stockfish были разные архитектуры и оборудование, поэтому матч нельзя считать обычным независимым тестом, в котором две программы работают на одинаковой системе.

Кроме того, DeepMind опубликовала только десять избранных партий. Они показали яркий стиль AlphaZero, но не позволяли полностью оценить весь эксперимент.

Матчи AlphaZero против Stockfish

Первый отчёт AlphaZero вызвал большой интерес к нейросетевым шахматным системам

Исследование 2018 года и матч из 1000 партий

В декабре 2018 года в журнале Science была опубликована расширенная оценка AlphaZero. В основном шахматном матче AlphaZero снова играла против Stockfish 8 — победителя девятого сезона TCEC.

Было сыграно 1000 партий с контролем по три часа на партию и добавлением 15 секунд за каждый ход. Итоговый результат AlphaZero:

155 побед, 839 ничьих и 6 поражений

Результаты AlphaZero против Stockfish в исследовании 2018 года

Результаты AlphaZero против Stockfish без дебютной книги и с сильной дебютной книгой

Stockfish использовал 44 ядра центрального процессора. AlphaZero работала на одной машине с четырьмя TPU первого поколения и 44 ядрами CPU. DeepMind подчёркивала, что каждая система использовала оборудование, для которого была спроектирована, но эти конфигурации нельзя напрямую приравнять друг к другу.

Исследователи также провели дополнительные матчи:

  • из распространённых человеческих дебютов;
  • из стартовых позиций суперфинала TCEC 2016 года;
  • против более свежей разрабатываемой версии Stockfish;
  • против Stockfish с сильной дебютной книгой;
  • при разном соотношении времени.

AlphaZero выиграла все серии матчей, хотя использование дебютной книги помогло Stockfish улучшить результаты в отдельных вариантах.

Результаты AlphaZero против Stockfish в популярных дебютах

Результаты AlphaZero в распространённых человеческих дебютах. Изображение можно увеличить

Были ли условия матча справедливыми?

Однозначного ответа нет, потому что AlphaZero и Stockfish представляли принципиально разные вычислительные подходы.

Критики первого эксперимента обращали внимание на несколько обстоятельств:

  • Stockfish играл без дебютной книги;
  • в первом отчёте использовался необычный контроль «одна минута на ход»;
  • аппаратные конфигурации невозможно корректно сравнить только по количеству процессоров;
  • Stockfish 8 не был настроен и протестирован независимыми организаторами специально для этого матча;
  • изначально было опубликовано небольшое количество партий.

Расширенное исследование 2018 года ответило на часть возражений: контроль времени был увеличен, появились матчи с дебютной книгой, разрабатываемой версией Stockfish и заранее заданными дебютными позициями.

Тем не менее матчи оставались внутренним исследованием DeepMind, а не независимым компьютерным чемпионатом. Корректный вывод состоит не в том, что AlphaZero была «абсолютно сильнее любого движка при любых условиях», а в том, что новый общий алгоритм самообучения смог на высоком уровне конкурировать с лидером традиционных компьютерных шахмат и убедительно победить его в опубликованных испытаниях.

Как играла AlphaZero?

Шахматистов особенно заинтересовал не только счёт матчей, но и характер партий. AlphaZero часто выбирала решения, которые выглядели понятными по общей идее, но были чрезвычайно сложны для точного расчёта.

К особенностям её стиля относили:

  • готовность жертвовать пешки и качество ради долговременной инициативы;
  • ограничение активности фигур соперника;
  • давление по всей доске вместо немедленной атаки одной цели;
  • необычные переводы ладей и короля;
  • большое внимание к пространству и мобильности;
  • последовательное развитие стратегической идеи на протяжении многих ходов.

Важно не превращать эти особенности в миф. AlphaZero не играла «как человек» и не отказывалась от расчёта вариантов. Её стиль был результатом сочетания нейронной оценки и направляемого поиска.

Также нельзя утверждать, что традиционные движки способны только на грубый перебор. Stockfish уже в то время использовал сложные алгоритмы поиска, отсечения и оценочные эвристики, а современные версии дополнительно применяют NNUE.

Влияние AlphaZero на шахматные движки

AlphaZero не стала доступным пользователям продуктом, но серьёзно повлияла на развитие компьютерных шахмат.

Leela Chess Zero

В 2018 году появился открытый проект Leela Chess Zero, или Lc0. Его целью было воспроизвести общий подход AlphaZero с помощью распределённого самообучения и доступного программного кода.

Lc0 стала одним из сильнейших шахматных движков и начала регулярно соревноваться со Stockfish в TCEC и других турнирах. При этом Lc0 не является копией AlphaZero и использует собственную реализацию, сети и инфраструктуру обучения.

Stockfish и NNUE

В 2020 году Stockfish интегрировал нейросетевую оценку NNUE. Это не означало переход на архитектуру AlphaZero: Stockfish сохранил альфа-бета-поиск и получил быстро обновляемую сеть, оптимизированную для центрального процессора.

В результате современные версии Stockfish сочетают традиционно сильный поиск с нейросетевой оценкой. Поэтому противопоставление «нейросеть против обычного перебора» сегодня устарело.

AlphaZero и варианты шахмат

В 2020 году исследователи DeepMind вместе с Владимиром Крамником опубликовали работу об использовании AlphaZero для оценки альтернативных шахматных правил.

Система обучалась заново для девяти вариантов:

  • шахматы без рокировки;
  • запрет рокировки только в первые десять ходов;
  • пешки могут ходить только на одно поле;
  • пат считается победой;
  • торпедные шахматы — пешка может пойти на два поля с любой горизонтали;
  • полуторпедные шахматы;
  • пешки могут возвращаться назад;
  • пешки могут ходить в сторону;
  • разрешено брать собственные фигуры.

Исследование не провозглашало какой-либо вариант заменой классическим шахматам. Его задача заключалась в том, чтобы оценить баланс, результативность и появляющиеся стратегические идеи без многолетней практики людей.

Особое внимание получил вариант без рокировки, который Крамник публично продвигал как способ уменьшить объём дебютной подготовки и создать новые типы позиций.

Партии AlphaZero против Stockfish

Атака при материальном дефиците

В первой партии AlphaZero отдаёт материал ради инициативы. После 19...Kxh6 у Stockfish есть материальное преимущество, но король чёрных находится под давлением, а ладья a8 и конь b8 долго не участвуют в игре.

Позиция из партии AlphaZero против Stockfish после 19 Kxh6

Материальное преимущество Stockfish не компенсирует отставание фигур и опасность для короля

После 36.Qe6 давление белых становится решающим.

 

Преимущество двух слонов в эндшпиле

Во втором примере AlphaZero получает длительное позиционное преимущество и постепенно усиливает давление. После 45.Bxe4 пара слонов становится важнейшим фактором эндшпиля.

 

20 дополнительных партий AlphaZero

Ниже собраны 20 избранных партий из опубликованных DeepMind материалов. Первая подборка сыграна без дебютной книги, вторая начинается из позиций дебютной книги, использовавшейся в TCEC 2016 года.

10 партий без дебютной книги

 

10 партий с дебютной книгой TCEC

 

Можно ли скачать AlphaZero?

Нет, официальной версии AlphaZero для скачивания не существует. Google DeepMind не публиковала исполняемый файл, готовую нейронную сеть или пользовательское приложение.

Страницы, предлагающие «скачать AlphaZero», обычно распространяют:

  • другой движок под известным названием;
  • неофициальную реализацию алгоритма;
  • Leela Chess Zero;
  • непроверенный или потенциально опасный файл.

Пользователю, который хочет попробовать близкий по общей идее открытый движок, следует использовать Leela Chess Zero. Для максимально сильного анализа на обычном центральном процессоре практичнее Stockfish.

AlphaZero сильнее современного Stockfish?

На этот вопрос нельзя достоверно ответить. Опубликованные матчи проводились в 2017–2018 годах против Stockfish 8, более свежей разрабатываемой версии того периода и отдельных конфигураций с дебютной книгой.

С тех пор Stockfish изменился очень значительно:

  • была внедрена нейросетевая оценка NNUE;
  • многократно улучшились поиск и распределение потоков;
  • появились новые архитектуры сетей;
  • движок прибавил сотни пунктов в специализированных тестах относительно старых версий.

AlphaZero не участвовала в независимых публичных матчах с современными версиями Stockfish. Поэтому формулировки «AlphaZero — сильнейший движок 2026 года» или «Stockfish 18 уже превзошёл AlphaZero» не подтверждены сопоставимым экспериментом.

Корректнее считать AlphaZero одной из наиболее влиятельных исследовательских систем в истории компьютерных шахмат, а не участником текущего рейтинга движков.

Частые вопросы

AlphaZero — это шахматный движок?

В широком смысле — да, поскольку система способна анализировать позиции и выбирать ходы. Но это не пользовательский UCI-движок, который можно подключить к Arena или ChessBase.

Чем AlphaZero отличается от AlphaGo?

AlphaGo создавалась прежде всего для игры в го и в ранних версиях использовала человеческие партии. AlphaZero была более общим алгоритмом, который обучался с нуля в шахматах, сёги и го через самостоятельную игру.

AlphaZero и Leela Chess Zero — одно и то же?

Нет. Lc0 — отдельный открытый проект, вдохновлённый опубликованными принципами AlphaZero. У него собственный код, сети и система распределённого обучения.

Сколько времени AlphaZero училась играть в шахматы?

По данным DeepMind, система впервые превзошла тестируемый Stockfish примерно через четыре часа, а полный описанный цикл обучения шахматам занимал около девяти часов. Это машинное время на специализированной инфраструктуре, а не обучение на одном домашнем компьютере.

Почему AlphaZero просматривала меньше позиций, чем Stockfish?

Нейронная сеть направляла поиск к наиболее перспективным продолжениям. Поэтому AlphaZero анализировала меньше узлов, но тратила больше вычислений на оценку и отбор каждого направления.

Продолжает ли Google DeepMind развивать AlphaZero?

AlphaZero стала основой и источником идей для последующих исследований, включая MuZero и работы по интерпретации знаний нейронных сетей. Однако новых публичных шахматных матчей AlphaZero с современными движками Google DeepMind не представляла.

Итоги

AlphaZero показала, что одна общая система может освоить шахматы, сёги и го через самообучение, не используя человеческие партии и вручную заданную шахматную оценку.

В 2017 году она выиграла 28 из 100 партий у Stockfish 8 без поражений. В расширенной оценке 2018 года AlphaZero одержала 155 побед, потерпела 6 поражений и завершила 839 партий вничью.

Главным наследием AlphaZero стали не только результаты матчей. Проект изменил отношение шахматного сообщества к нейронным сетям, вдохновил Leela Chess Zero, повлиял на развитие других программ и показал новые способы исследования шахматных идей и вариантов правил.

При этом AlphaZero нельзя скачать, она не участвует в современных рейтингах, а результаты против версий Stockfish 2017–2018 годов нельзя напрямую переносить на Stockfish 18.

Практический совет Партии AlphaZero лучше изучать не как набор компьютерных комбинаций, а как примеры долгосрочной компенсации, ограничения фигур и последовательного усиления инициативы.

Для системной работы над тактикой, позиционной игрой, атакой и эндшпилем можно воспользоваться программой обучения «Шахматы. Перезагрузка за 21 день».

НЕТ ПРОГРЕССА В ШАХМАТАХ?

Вам поможет 21-дневный интенсив по шахматам. Гарантия!

Полезные статьи


© Copyright 2011- Шахматный клуб XChess.ru. Все права защищены!