中文

基于逆游戏的交互式策略结构化模仿学习

机器人学 2025-11-18 v1 机器学习

摘要

基于生成模型的模仿学习方法最近在从人类演示中学习高复杂度运动技能方面取得了显著成果。然而,由于互动策略在共享空间中与人类协调而没有明确通信的行为复杂度远高于非互动任务,学习交互式策略仍然具有挑战性。本文引入了一种用于交互式策略的结构化模仿学习框架,通过将生成的单智能体策略学习与灵活且有表现力的博弈论结构相结合。我们的方法显式地将学习分为两个步骤:首先,使用标准模仿学习从多智能体演示中学习 individual 行为模式;然后,通过求解逆博弈问题来结构化学习智能体之间的依赖关系。合成的5智能体社交导航任务中的初步结果表明,我们的方法在提升非互动策略方面具有显著优势,并且仅使用50个演示即可对等于ground truth交互式策略。这些结果凸显了结构化模仿学习在交互环境中潜力的重要性。

关键词

引用

@article{arxiv.2511.12848,
  title  = {Structured Imitation Learning of Interactive Policies through Inverse Games},
  author = {Max M. Sun and Todd Murphey},
  journal= {arXiv preprint arXiv:2511.12848},
  year   = {2025}
}

备注

Presented at the "Workshop on Generative Modeling Meets Human-Robot Interaction" at Robotics: Science and Systems 2025. Workshop website: https://sites.google.com/view/gai-hri/