PECAN:利用策略集成实现上下文感知的零样本人-AI 协作
人工智能
2023-05-23 v4
摘要
零样本人-AI 协作有望在不使用人类数据的情况下与人类合作。主流方法试图通过自博弈(self-play)与一组伙伴训练自我智能体(ego agent)。然而,这些方法存在两个问题:1) 有限伙伴构成的群体多样性受限,从而限制了训练所得自我智能体与新人类协作的能力;2) 当前方法仅为群体中每个伙伴提供通用的纳什最佳响应(best response),这可能导致与新伙伴或人类的零样本协作表现不佳。为解决这些问题,我们首先提出策略集成(policy ensemble)方法以增加群体中伙伴的多样性,随后开发了一种上下文感知方法,使自我智能体能够分析并识别伙伴的潜在策略基元(policy primitives),从而采取相应不同动作。借此,自我智能体能够学习更具通用性的协作行为以与多样化伙伴合作。我们在 Overcooked 环境中开展实验,并利用行为克隆的人类代理(behavior-cloned human proxies)与真实人类评估本方法的零样本人-AI 协作表现。结果表明,我们的方法显著增加了伙伴多样性,并使自我智能体比基线学习到更多样的行为,从而在全部场景中达到 state-of-the-art(SOTA)性能。我们还开源了基于 Overcooked 的人-AI 协作研究框架,以方便后续研究。
引用
@article{arxiv.2301.06387,
title = {PECAN: Leveraging Policy Ensemble for Context-Aware Zero-Shot Human-AI Coordination},
author = {Xingzhou Lou and Jiaxian Guo and Junge Zhang and Jun Wang and Kaiqi Huang and Yali Du},
journal= {arXiv preprint arXiv:2301.06387},
year = {2023}
}
备注
Accepted by AAMAS 2023