中文

CIVIL:因果与直观视觉模仿学习

机器人学 2025-10-28 v3 机器学习 系统与控制 系统与控制

摘要

当今的机器人尝试通过模仿人类示例来学习新任务。这些机器人观察人类完成任务,然后尝试匹配人类专家所采取的动作。然而,这种标准的视觉模仿学习方法存在根本性的局限性:机器人只观察到人类所执行的动作,而未理解人类为何选择这些行为。没有对系统或环境中哪些特征对人类的决策起作用的理解,机器人学习者常常会误解人类的示例。在实际应用中,这会导致因果混淆、学习效率低下以及机器人策略在环境变化时失败。因此,我们提出了一种视角的转变:不仅要求人类教师展示机器人应采取的动作,还使人类能够直观地表述他们做出这些决定的原因。在我们的范式下,人类教师为任务相关对象附加标记,并使用自然语言提示来描述其状态表示。我们的 proposed algorithm CIVIL利用这些增强的演示数据来过滤机器人的视觉观察,并提取出与人类教师一致的特征表示。CIVIL然后将这些因果特征用于训练基于Transformer的策略——在机器人上进行测试时,能够在视觉干扰或无关项目的干扰下模拟人类的行为。我们的仿真和实际实验表明,使用CIVIL训练的机器人能够学习既要采取什么动作,也要为何采取这些动作,性能优于最先进的基线方法。从人类的角度来看,我们的用户研究显示,这种新的训练范式实际上减少了机器人学习任务所需的总时间,并且还能提高在先前未遇到的情景下的机器人性能。详见我们的项目网站视频:https://civil2025.github.io

关键词

引用

@article{arxiv.2504.17959,
  title  = {CIVIL: Causal and Intuitive Visual Imitation Learning},
  author = {Yinlong Dai and Robert Ramirez Sanchez and Ryan Jeronimus and Shahabedin Sagheb and Cara M. Nunez and Heramb Nemlekar and Dylan P. Losey},
  journal= {arXiv preprint arXiv:2504.17959},
  year   = {2025}
}