通过心智理论推理的多智能体逆强化学习
人工智能
2023-12-20 v2 机器学习
多智能体系统
摘要
我们通过多智能体逆强化学习(MIRL)研究人们在协作环境中如何相互交互的问题,尤其当个体对其队友知之甚少时;其目标是在给定某任务中团队行为轨迹的情况下,推断指导每个个体行为的奖励函数。与当前 MIRL 方法不同,我们不假设团队成员先验知晓彼此目标;而是假设他们通过适应由观察他人行为所感知到的他人目标来协作,同时联合执行任务。为解决该问题,我们提出一种通过心智理论(ToM)的 MIRL 新方法(MIRL-ToM)。对每个智能体,我们首先使用 ToM 推理根据其示范行为估计基线奖励轮廓上的后验分布。随后我们通过分散均衡执行 MIRL,采用单智能体最大熵 IRL 推断每个智能体的奖励函数,其中我们根据随时间变化的轮廓分布模拟其他队友的行为。我们在一个模拟的双人搜救行动中评估我们的方法,其中扮演不同角色的智能体目标是在环境中搜索并撤离受害者。结果表明,基线轮廓的选择对恢复真实奖励至关重要,且 MIRL-ToM 能够恢复与已知及未知队友交互的智能体所使用的奖励。
引用
@article{arxiv.2302.10238,
title = {Multiagent Inverse Reinforcement Learning via Theory of Mind Reasoning},
author = {Haochen Wu and Pedro Sequeira and David V. Pynadath},
journal= {arXiv preprint arXiv:2302.10238},
year = {2023}
}
备注
Accepted as a full paper at AAMAS2023