轻量级游戏智能体强度因素的金标准研究
机器学习
2026-07-07 v1 人工智能
计算机科学与博弈论
摘要
用于不完美信息纸牌游戏的强化学习智能体的强度仅取决于其训练的对手,并且它们难以评估,因为它们击败随机对手的概率超过 99%,并且只能与自身的副本打平。因此,我们为金拉米牌构建了一个强大的、固定的、基于规则的专家,并仅将其用作衡量标准,绝不用于训练。它以 70% 到 99% 的概率击败我们训练的每个智能体。在超过一百次运行中,我们分离出了使轻量级智能体更强的因素。信任区域更新、目标明确的奖励、更强大对手的课程、热启动以及保留最佳检查点都有帮助,将它们叠加起来可以将自对弈冠军对专家的胜率从约 30% 提升到 36%。有几个想法没有奏效。短期和长期奖励塑形、学习的状态嵌入、模仿学习和 DAgger,以及一个实时的大型语言模型对手,要么没有帮助,要么太慢,要么太重而无法大规模训练。比较 MLP、卷积、基于集合、注意力和循环编码器表明,额外的容量对突破上限几乎没有作用,这表明限制在于信息而非网络规模。我们添加了标准基线(神经虚构自对弈和信息集蒙特卡洛搜索),并确认该方法可推广到 Leduc 德州扑克,其中最优解是可计算的。结果是一个轻量级、与游戏无关的配方,可以在不针对专家进行训练的情况下,为任何小型模型可以处理的游戏训练出有竞争力的智能体,并以稳健的统计数据报告,作为可重用包发布。
引用
@article{arxiv.2607.06854,
title = {A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong},
author = {Nima Kelidari and Mohammadsaeed Haghi and Mahdi Salmani},
journal= {arXiv preprint arXiv:2607.06854},
year = {2026}
}
备注
9 pages, 5 figures, 3 tables. Code and models: https://github.com/Nikelroid/adversarial-coevolution