中文

真实世界非结构化行人群体中的多智能体逆强化学习

机器人学 2025-03-28 v3 人工智能 机器学习 多智能体系统

摘要

在拥挤的公共场所(如大学校园、餐厅、杂货店和医院)中的社交机器人导航是一个日益重要的研究领域。实现这一目标的核心策略之一是通过学习人类的奖励函数来理解他们的意图——控制其运动的潜在心理因素,通常通过逆强化学习(IRL)来实现。尽管IRL取得了显著进展,但由于在这些场景中发生的紧密耦合的社会交互(例如,通过、交叉、转弯、穿梭等)的性质,在密集的非结构化行人群体中同时学习多个智能体的奖励函数仍然难以处理。在本文中,我们提出了一种用于真实世界非结构化行人群体的新多智能体最大熵逆强化学习算法。我们方法的关键是一个简单但有效的数学技巧,我们称之为可处理性-理性权衡技巧,它以轻微降低精度为代价实现了可处理性。我们将我们的方法与经典的单智能体MaxEnt IRL以及最先进的轨迹预测方法在多个数据集上进行了比较,包括ETH、UCY、SCAND、JRDB和一个名为Speedway的新数据集(该数据集是在大学校园的一个繁忙路口收集的,侧重于密集、复杂的智能体交互)。我们的主要发现表明,在密集的Speedway数据集上,我们的方法在7个基线中排名第一,比单智能体IRL提高了2倍以上,并且在较稀疏的数据集(如ETH/UCY)上与最先进的基于大型Transformer的编码器-解码器模型具有竞争力(在7个基线中排名第三)。

关键词

引用

@article{arxiv.2405.16439,
  title  = {Multi-Agent Inverse Reinforcement Learning in Real World Unstructured Pedestrian Crowds},
  author = {Rohan Chandra and Haresh Karnan and Negar Mehr and Peter Stone and Joydeep Biswas},
  journal= {arXiv preprint arXiv:2405.16439},
  year   = {2025}
}