中文

基于人类决策模型强化学习以构建独特协作型 AI 队友

人工智能 2021-11-19 v1 机器学习

摘要

2021 年,约翰斯·霍普金斯大学应用物理实验室举办了一项内部挑战赛,旨在开发能在协作纸牌游戏 Hanabi 中表现出色的智能(AI)体。评估标准为这些 AI 体与从未谋面的真实人类玩家对局的能力。本研究详述了赢得该挑战赛的 AI 体开发过程:其人类对局平均得分达 16.5,超越了当前人-机 Hanabi 得分的最优水平。该获胜 AI 体的开发包括观察并精确建模作者在 Hanabi 中的决策过程,随后利用作者的行为克隆进行训练。值得注意的是,该 AI 体通过先模仿人类决策、再探索类人策略中能提升模拟人-机得分的变体,发现了一种与人类互补的出牌风格。本文深入探讨了这一人类兼容 Hanabi 队友的设计与实现,以及人类互补策略的存在与意义,并论述如何探索此类策略以在人机团队中更成功地应用 AI。

关键词

引用

@article{arxiv.2111.09800,
  title  = {Reinforcement Learning on Human Decision Models for Uniquely Collaborative AI Teammates},
  author = {Nicholas Kantack},
  journal= {arXiv preprint arXiv:2111.09800},
  year   = {2021}
}

备注

8 pages (10 pages with references and appendix), 6 figures