基于人类决策模型强化学习以构建独特协作型 AI 队友
人工智能
2021-11-19 v1 机器学习
摘要
2021 年,约翰斯·霍普金斯大学应用物理实验室举办了一项内部挑战赛,旨在开发能在协作纸牌游戏 Hanabi 中表现出色的智能(AI)体。评估标准为这些 AI 体与从未谋面的真实人类玩家对局的能力。本研究详述了赢得该挑战赛的 AI 体开发过程:其人类对局平均得分达 16.5,超越了当前人-机 Hanabi 得分的最优水平。该获胜 AI 体的开发包括观察并精确建模作者在 Hanabi 中的决策过程,随后利用作者的行为克隆进行训练。值得注意的是,该 AI 体通过先模仿人类决策、再探索类人策略中能提升模拟人-机得分的变体,发现了一种与人类互补的出牌风格。本文深入探讨了这一人类兼容 Hanabi 队友的设计与实现,以及人类互补策略的存在与意义,并论述如何探索此类策略以在人机团队中更成功地应用 AI。
引用
@article{arxiv.2111.09800,
title = {Reinforcement Learning on Human Decision Models for Uniquely Collaborative AI Teammates},
author = {Nicholas Kantack},
journal= {arXiv preprint arXiv:2111.09800},
year = {2021}
}
备注
8 pages (10 pages with references and appendix), 6 figures