稀疏奖励游戏中的AlphaZero:局限性与辅助监督
机器学习
2026-07-09 v1 人工智能
计算机科学与博弈论
组合数学
摘要
AlphaZero已经证明,神经引导的蒙特卡洛树搜索可以实现超人性能,但强大的棋力并不一定意味着完美对弈。我们在两个具有对比结构的、可通过oracle评估的领域中研究这一差距:Connect Four,一个具有精确博弈论值的已解决偏序游戏,以及Chomp,一个最优对弈由Grundy数结构支配的公正游戏。在统一的自我对弈+ MCTS流程下,我们比较了vanilla AlphaZero、一个多帧变体(仅限于Chomp)和一个添加了oracle派生策略监督的AlphaZero辅助损失(AZAL)。我们发现,vanilla AlphaZero在两个领域都实现了强大的棋力,但无法保持最优对弈所需的精确轨迹:在Connect Four中,它未能维持最优对弈路线,而在Chomp中,它未能一致地恢复不变量。在矩形Chomp棋盘上,仅多帧输入并不能消除这一差距。然而,AZAL在多种子完整游戏轨迹和采样状态评估中显著提高了oracle一致性。在Chomp上,AZAL在10x11上达到了完美的完整游戏oracle一致性,在9x10上达到了高但不完全的一致性;在Connect Four上,AZAL提高了oracle匹配率并延迟了第一次oracle错误,但未达到完美对弈。
引用
@article{arxiv.2607.08984,
title = {AlphaZero in Sparsely Rewarded Games: Limits and Auxiliary Supervision},
author = {Brent Kong and Tejas Ram and Tony Yue Yu},
journal= {arXiv preprint arXiv:2607.08984},
year = {2026}
}