中文

Masked IRL: 基于演示与语言的 LLM 引导奖励消歧

机器人学 2026-04-01 v2 人工智能

摘要

机器人可以通过从演示中学习奖励函数来适应用户偏好,但在数据有限的情况下,奖励模型常会过拟合到虚假关联,从而难以泛化。这发生的原因是演示展示了机器人如何完成任务,但并未说明该任务的关键在于什么,从而导致模型关注无关的状态细节。自然语言可以更直接地指定机器人应关注的重点,从而在理论上消歧多种与演示一致的奖励函数。然而,现有的语言条件奖励学习方法通常将指令视为简单的条件信号,未充分发挥其消歧潜力。此外,真实指令本身常常是模糊的,因此直接的条件化方法不可靠。我们的关键洞察是,这两种输入类型携带互补信息:演示显示如何行动,而语言指定什么是重要的。我们提出了掩码逆强化学习(Masked IRL),一种框架利用大型语言模型(LLM)结合这两种输入类型的优势。Masked IRL 从语言指令中推断状态相关性掩码,并强制对无关状态组件保持不变性。当指令模糊时,它会利用 LLM 的推理能力在演示语境中澄清指令。在仿真环境和实际机器人上,Masked IRL 在样本效率、泛化能力和对模糊语言的鲁棒性方面,相较于先前的语言条件 IRL 方法提升了最高可达 15%,同时使用的数据量最高可减少 4.7 倍。项目页面:https://MIT-CLEAR-Lab.github.io/Masked-IRL 和代码:https://github.com/MIT-CLEAR-Lab/Masked-IRL

关键词

引用

@article{arxiv.2511.14565,
  title  = {Masked IRL: LLM-Guided Reward Disambiguation from Demonstrations and Language},
  author = {Minyoung Hwang and Alexandra Forsey-Smerek and Nathaniel Dennler and Andreea Bobu},
  journal= {arXiv preprint arXiv:2511.14565},
  year   = {2026}
}

备注

Accepted to ICRA 2026