一种面向人机协作的群体训练分层方法
人工智能
2023-05-29 v1 机器学习
多智能体系统
摘要
深度强化学习(DRL)智能体的一个主要挑战是与训练阶段未遇到的陌生伙伴协作。当 DRL 智能体与人协作时,由于人类行为缺乏一致性导致动作响应方差增大,该问题尤为严重。近期研究表明,将单一智能体训练为对多样化训练伙伴群体最优响应,可显著提升其对陌生伙伴的鲁棒性。我们通过引入一种基于分层强化学习(HRL)的人机协作方法进一步增强基于群体的训练方法。我们的智能体能够学习多种最优响应策略作为其底层策略,同时学习一个作为管理者的最高层策略,使智能体可根据当前伙伴动态切换底层最优响应策略。我们证明了我们的方法能够在双人协作 Overcooked 游戏环境中动态适应不同游玩风格与技能水平的陌生伙伴。我们还在同一环境中开展了人类研究,以测试我们的方法在与真实人类对象协作时的有效性。
引用
@article{arxiv.2305.16708,
title = {A Hierarchical Approach to Population Training for Human-AI Collaboration},
author = {Yi Loo and Chen Gong and Malika Meghjani},
journal= {arXiv preprint arXiv:2305.16708},
year = {2023}
}
备注
IJCAI 2023