Команда MIT, Carnegie Mellon, NYU та Stanford створила систему Ataraxos для стратегічних ігор, у яких гравець не бачить усіх дій і ресурсів суперника. У випробуваннях вона перемогла сильних людей-гравців у Stratego — складній настільній грі з прихованими фігурами. Дослідження опубліковано в Nature; деталі наводить MIT.
Складність — не лише в кількості ходів
На відміну від шахів, у Stratego неможливо бачити всю позицію. Суперник може приховувати цінні фігури та блефувати, а кожен хід дає лише частину нової інформації. Тому система мусить одночасно планувати власні дії й оцінювати кілька можливих картин гри. Розробники поєднали ефективні алгоритми навчання з методами ухвалення рішень за неповної інформації.
Ataraxos перевірили не лише в стандартній Stratego. За повідомленням команди, він також показав високий результат у Barrage Stratego, кооперативній грі Hanabi та Dou dizhu. Це свідчить, що підхід не прив’язаний до одних правил.
Від гри до практики ще далеко
Автори вбачають потенціал для задач, де інтереси сторін і дані неповні, але не стверджують, що модель уже придатна для військових або бізнес-рішень. У реальному світі правила менш чіткі, а наслідки помилки набагато серйозніші. Дослідники окремо наголошують на потребі зробити рекомендації системи зрозумілими людині та залишити за нею остаточне рішення.
Про інший підхід до надійності алгоритмів ми писали в новині про те, як MIT навчив ШІ дотримуватися жорстких обмежень у тестових задачах.