中文

用于零样本人-AI协作的最大熵基于种群的训练

人工智能 2022-06-28 v3

摘要

我们研究在不使用任何人类数据的情况下,训练一个与人类协作的强化学习(RL)智能体的问题。尽管此类智能体可通过自博弈训练获得,但当与未遇到过的伙伴(如人类)配对时,它们可能会受到分布偏移的显著影响。为缓解此分布偏移,我们提出最大熵基于种群的训练(MEP)。在MEP中,种群中的智能体通过我们推导的种群熵奖励进行训练,以促进智能体之间的成对多样性以及智能体自身的个体多样性,并通过优先采样与该多样化种群中的智能体配对来训练一个共同的最优智能体。优先级根据训练进度动态调整。我们在Overcooked游戏环境中,以人类代理模型和真实人类作为伙伴,与自博弈PPO(SP)、基于种群的训练(PBT)、轨迹多样性(TrajeDi)和虚拟协同博弈(FCP)进行比较,证明了我们的方法MEP的有效性。展示实验结果的补充视频可在 https://youtu.be/Xh-FKD0AAKE 获取。

关键词

引用

@article{arxiv.2112.11701,
  title  = {Maximum Entropy Population-Based Training for Zero-Shot Human-AI Coordination},
  author = {Rui Zhao and Jinming Song and Yufeng Yuan and Hu Haifeng and Yang Gao and Yi Wu and Zhongqian Sun and Yang Wei},
  journal= {arXiv preprint arXiv:2112.11701},
  year   = {2022}
}

备注

Accepted by NeurIPS Cooperative AI Workshop, 2021, link: https://www.cooperativeai.com/workshop/neurips-2021#Workshop-Papers. Under review at a conference