中文

反事实行为克隆:来自不完美人类演示的离线模仿学习

机器人学 2025-05-19 v1

摘要

从人类那里学习具有挑战性,因为人类并非完美的教师。当日常人向机器人展示新任务时,人类不可避免地会犯错(例如输入噪声动作)并提供次优示例(例如目标超车)。现有方法通过模仿人类教师提供的确切行为来学习——但这种方法受限于演示本身不完美。在本工作中,我们通过使机器人能够推断人类教师的意图(而不仅仅是观察实际展示的行为),来推进离线模仿学习。我们实现这一目标的关键在于假设人类的所有演示都旨在传递单一、一致的策略,而噪声和次优性行为则掩盖了数据并引入了非本意的复杂性。为恢复 underlying policy 并学习人类教师的意图,我们引入Counter-BC,这是一种行为克隆的通用版本。Counter-BC 将给定数据集扩展以包含接近人类演示的动作(即人类教师可能意图但实际并未展示的反事实动作)。在训练期间,Counter-BC 在这个扩展区域内自主修改人类的演示,以达到一个简单且一致的策略,从而解释人类数据集中的 underlying 趋势。理论上,我们证明了Counter-BC能够从不完美的数据、多个用户以及技能水平不同的教师中提取所需策略。实证上,我们在模拟环境和真实世界场景中与最先进的方法进行比较,分别针对噪声演示、标准数据集和真实人类教师进行测试。

关键词

引用

@article{arxiv.2505.10760,
  title  = {Counterfactual Behavior Cloning: Offline Imitation Learning from Imperfect Human Demonstrations},
  author = {Shahabedin Sagheb and Dylan P. Losey},
  journal= {arXiv preprint arXiv:2505.10760},
  year   = {2025}
}