В декабре 2017 года шахматный мир обсуждал необычный результат: исследовательская система AlphaZero, обучившаяся шахматам через игру с самой собой, выиграла тестовый матч у Stockfish 8. Её партии с ранними жертвами материала и долгосрочными атаками произвели огромное впечатление на гроссмейстеров и разработчиков шахматных программ.
Однако AlphaZero — не обычный шахматный движок, который можно скачать и установить. Это закрытая исследовательская система DeepMind, созданная для изучения универсального самообучающегося алгоритма.
AlphaZero — система искусственного интеллекта, разработанная компанией DeepMind, которая сегодня входит в Google DeepMind. Она создавалась не только для шахмат: один и тот же общий алгоритм обучался игре в шахматы, сёги и го.
В отличие от традиционных шахматных программ, AlphaZero начинала обучение без дебютной книги, эндшпильных таблиц и базы человеческих партий. В систему были заложены правила игры, после чего она совершенствовалась в миллионах партий с самой собой.
AlphaZero была разработана исследовательской компанией DeepMind
Первый предварительный отчёт был опубликован в декабре 2017 года. Полное исследование, охватывающее шахматы, сёги и го, появилось в журнале Science в декабре 2018 года.
Название AlphaZero иногда используют как синоним нейросетевого шахматного движка, но это не совсем верно. AlphaZero была конкретной исследовательской системой. Доступные пользователям проекты, такие как Leela Chess Zero, лишь воспроизводят общие идеи самообучения и нейросетевого поиска.
AlphaZero использовала обучение с подкреплением. Система играла сама с собой, получала результат партии и постепенно корректировала параметры нейронной сети.
В начале обучение фактически начиналось со случайной игры. Со временем сеть училась распознавать полезные шахматные закономерности:
По данным DeepMind, в шахматах AlphaZero впервые превзошла тестируемый Stockfish примерно через четыре часа обучения. Полный тренировочный цикл для опубликованной версии занимал около девяти часов.
Для каждой позиции нейронная сеть AlphaZero формировала два основных результата:
Сеть не просто присваивала позиции численное значение, но и подсказывала алгоритму, какие продолжения следует изучить в первую очередь.
Для выбора хода AlphaZero применяла поиск по дереву Монте-Карло — MCTS. Нейронная сеть направляла поиск к перспективным ветвям, поэтому системе не требовалось рассматривать столько же позиций, сколько традиционным движкам.
AlphaZero анализировала значительно меньше позиций, но тщательнее отбирала направления поиска
В исследовании 2018 года AlphaZero рассматривала около 60 тысяч позиций в секунду, тогда как Stockfish — примерно 60 миллионов. Эти числа нельзя использовать для прямого измерения силы: системы применяли разные архитектуры и по-разному расходовали вычислительные ресурсы.
В декабре 2017 года DeepMind сообщила о предварительном эксперименте с участием AlphaZero и Stockfish 8.
В матче из 100 партий AlphaZero показала результат:
28 побед, 72 ничьи и 0 поражений
Контроль времени составлял одну минуту на ход. В опубликованной конфигурации Stockfish играл без дебютной книги и без эндшпильных таблиц.
Результат вызвал огромный интерес, но одновременно и вопросы к условиям сравнения. У AlphaZero и Stockfish были разные архитектуры и оборудование, поэтому матч нельзя считать обычным независимым тестом, в котором две программы работают на одинаковой системе.
Кроме того, DeepMind опубликовала только десять избранных партий. Они показали яркий стиль AlphaZero, но не позволяли полностью оценить весь эксперимент.
Первый отчёт AlphaZero вызвал большой интерес к нейросетевым шахматным системам
В декабре 2018 года в журнале Science была опубликована расширенная оценка AlphaZero. В основном шахматном матче AlphaZero снова играла против Stockfish 8 — победителя девятого сезона TCEC.
Было сыграно 1000 партий с контролем по три часа на партию и добавлением 15 секунд за каждый ход. Итоговый результат AlphaZero:
155 побед, 839 ничьих и 6 поражений
Результаты AlphaZero против Stockfish без дебютной книги и с сильной дебютной книгой
Stockfish использовал 44 ядра центрального процессора. AlphaZero работала на одной машине с четырьмя TPU первого поколения и 44 ядрами CPU. DeepMind подчёркивала, что каждая система использовала оборудование, для которого была спроектирована, но эти конфигурации нельзя напрямую приравнять друг к другу.
Исследователи также провели дополнительные матчи:
AlphaZero выиграла все серии матчей, хотя использование дебютной книги помогло Stockfish улучшить результаты в отдельных вариантах.
Однозначного ответа нет, потому что AlphaZero и Stockfish представляли принципиально разные вычислительные подходы.
Критики первого эксперимента обращали внимание на несколько обстоятельств:
Расширенное исследование 2018 года ответило на часть возражений: контроль времени был увеличен, появились матчи с дебютной книгой, разрабатываемой версией Stockfish и заранее заданными дебютными позициями.
Тем не менее матчи оставались внутренним исследованием DeepMind, а не независимым компьютерным чемпионатом. Корректный вывод состоит не в том, что AlphaZero была «абсолютно сильнее любого движка при любых условиях», а в том, что новый общий алгоритм самообучения смог на высоком уровне конкурировать с лидером традиционных компьютерных шахмат и убедительно победить его в опубликованных испытаниях.
Шахматистов особенно заинтересовал не только счёт матчей, но и характер партий. AlphaZero часто выбирала решения, которые выглядели понятными по общей идее, но были чрезвычайно сложны для точного расчёта.
К особенностям её стиля относили:
Важно не превращать эти особенности в миф. AlphaZero не играла «как человек» и не отказывалась от расчёта вариантов. Её стиль был результатом сочетания нейронной оценки и направляемого поиска.
Также нельзя утверждать, что традиционные движки способны только на грубый перебор. Stockfish уже в то время использовал сложные алгоритмы поиска, отсечения и оценочные эвристики, а современные версии дополнительно применяют NNUE.
AlphaZero не стала доступным пользователям продуктом, но серьёзно повлияла на развитие компьютерных шахмат.
В 2018 году появился открытый проект Leela Chess Zero, или Lc0. Его целью было воспроизвести общий подход AlphaZero с помощью распределённого самообучения и доступного программного кода.
Lc0 стала одним из сильнейших шахматных движков и начала регулярно соревноваться со Stockfish в TCEC и других турнирах. При этом Lc0 не является копией AlphaZero и использует собственную реализацию, сети и инфраструктуру обучения.
В 2020 году Stockfish интегрировал нейросетевую оценку NNUE. Это не означало переход на архитектуру AlphaZero: Stockfish сохранил альфа-бета-поиск и получил быстро обновляемую сеть, оптимизированную для центрального процессора.
В результате современные версии Stockfish сочетают традиционно сильный поиск с нейросетевой оценкой. Поэтому противопоставление «нейросеть против обычного перебора» сегодня устарело.
В 2020 году исследователи DeepMind вместе с Владимиром Крамником опубликовали работу об использовании AlphaZero для оценки альтернативных шахматных правил.
Система обучалась заново для девяти вариантов:
Исследование не провозглашало какой-либо вариант заменой классическим шахматам. Его задача заключалась в том, чтобы оценить баланс, результативность и появляющиеся стратегические идеи без многолетней практики людей.
Особое внимание получил вариант без рокировки, который Крамник публично продвигал как способ уменьшить объём дебютной подготовки и создать новые типы позиций.
В первой партии AlphaZero отдаёт материал ради инициативы. После 19...Kxh6 у Stockfish есть материальное преимущество, но король чёрных находится под давлением, а ладья a8 и конь b8 долго не участвуют в игре.
Материальное преимущество Stockfish не компенсирует отставание фигур и опасность для короля
После 36.Qe6 давление белых становится решающим.
Во втором примере AlphaZero получает длительное позиционное преимущество и постепенно усиливает давление. После 45.Bxe4 пара слонов становится важнейшим фактором эндшпиля.
Ниже собраны 20 избранных партий из опубликованных DeepMind материалов. Первая подборка сыграна без дебютной книги, вторая начинается из позиций дебютной книги, использовавшейся в TCEC 2016 года.
Нет, официальной версии AlphaZero для скачивания не существует. Google DeepMind не публиковала исполняемый файл, готовую нейронную сеть или пользовательское приложение.
Страницы, предлагающие «скачать AlphaZero», обычно распространяют:
Пользователю, который хочет попробовать близкий по общей идее открытый движок, следует использовать Leela Chess Zero. Для максимально сильного анализа на обычном центральном процессоре практичнее Stockfish.
На этот вопрос нельзя достоверно ответить. Опубликованные матчи проводились в 2017–2018 годах против Stockfish 8, более свежей разрабатываемой версии того периода и отдельных конфигураций с дебютной книгой.
С тех пор Stockfish изменился очень значительно:
AlphaZero не участвовала в независимых публичных матчах с современными версиями Stockfish. Поэтому формулировки «AlphaZero — сильнейший движок 2026 года» или «Stockfish 18 уже превзошёл AlphaZero» не подтверждены сопоставимым экспериментом.
Корректнее считать AlphaZero одной из наиболее влиятельных исследовательских систем в истории компьютерных шахмат, а не участником текущего рейтинга движков.
В широком смысле — да, поскольку система способна анализировать позиции и выбирать ходы. Но это не пользовательский UCI-движок, который можно подключить к Arena или ChessBase.
AlphaGo создавалась прежде всего для игры в го и в ранних версиях использовала человеческие партии. AlphaZero была более общим алгоритмом, который обучался с нуля в шахматах, сёги и го через самостоятельную игру.
Нет. Lc0 — отдельный открытый проект, вдохновлённый опубликованными принципами AlphaZero. У него собственный код, сети и система распределённого обучения.
По данным DeepMind, система впервые превзошла тестируемый Stockfish примерно через четыре часа, а полный описанный цикл обучения шахматам занимал около девяти часов. Это машинное время на специализированной инфраструктуре, а не обучение на одном домашнем компьютере.
Нейронная сеть направляла поиск к наиболее перспективным продолжениям. Поэтому AlphaZero анализировала меньше узлов, но тратила больше вычислений на оценку и отбор каждого направления.
AlphaZero стала основой и источником идей для последующих исследований, включая MuZero и работы по интерпретации знаний нейронных сетей. Однако новых публичных шахматных матчей AlphaZero с современными движками Google DeepMind не представляла.
AlphaZero показала, что одна общая система может освоить шахматы, сёги и го через самообучение, не используя человеческие партии и вручную заданную шахматную оценку.
В 2017 году она выиграла 28 из 100 партий у Stockfish 8 без поражений. В расширенной оценке 2018 года AlphaZero одержала 155 побед, потерпела 6 поражений и завершила 839 партий вничью.
Главным наследием AlphaZero стали не только результаты матчей. Проект изменил отношение шахматного сообщества к нейронным сетям, вдохновил Leela Chess Zero, повлиял на развитие других программ и показал новые способы исследования шахматных идей и вариантов правил.
При этом AlphaZero нельзя скачать, она не участвует в современных рейтингах, а результаты против версий Stockfish 2017–2018 годов нельзя напрямую переносить на Stockfish 18.
Практический совет Партии AlphaZero лучше изучать не как набор компьютерных комбинаций, а как примеры долгосрочной компенсации, ограничения фигур и последовательного усиления инициативы.
Для системной работы над тактикой, позиционной игрой, атакой и эндшпилем можно воспользоваться программой обучения «Шахматы. Перезагрузка за 21 день».
