在 Hanabi 中生成并适应多样化的临时合作智能体
人工智能
2022-08-31 v3 神经与进化计算
摘要
Hanabi 是一款将建模其他玩家的问题置于前沿的合作游戏。在此游戏中,协调的玩家群体可利用预先建立的约定取得巨大成效,但在临时(ad-hoc)设定下进行游戏,要求智能体在未曾预先协调的情况下适应其伙伴的策略。在此设定下评估一个智能体需要多样化的潜在伙伴群体,但迄今为止,智能体行为多样性尚未以系统的方式被考量。本文提出质量多样性(Quality Diversity)算法作为用于此目的生成多样化群体的一类有前景的算法,并使用 MAP-Elites 生成了一组多样化的 Hanabi 智能体。我们还假定智能体在训练期间可受益于多样化群体,并实现了一个简单的“元策略”以适应智能体所感知到的行为生态位。我们表明,若其伙伴的行为生态位能被正确推断,该元策略甚至在其训练所用的群体之外也能优于通用策略,但在实践中,伙伴的行为取决于并干扰元智能体自身的行为,这为刻画游戏过程中另一智能体行为的研究指明了方向。
引用
@article{arxiv.2004.13710,
title = {Generating and Adapting to Diverse Ad-Hoc Cooperation Agents in Hanabi},
author = {Rodrigo Canaan and Xianbo Gao and Julian Togelius and Andy Nealen and Stefan Menzel},
journal= {arXiv preprint arXiv:2004.13710},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:1907.03840. In early access at R. Canaan, X. Gao, J. Togelius, A. Nealen and S. Menzel, "Generating and Adapting to Diverse Ad-Hoc Partners in Hanabi," in IEEE Transactions on Games,