中文

RECON:利用人工放置标记减少因果混淆

机器人学 2025-03-04 v2

摘要

模仿学习使机器人能够从人类示例中学习新任务。向人类学习时的一个基本限制是因果混淆。当机器人的观察同时包含任务相关和无关信息时,就会发生因果混淆:例如,机器人的摄像头可能不仅看到预期目标,还会看到环境中的杂乱和光照变化。由于机器人事先不知道其观察的哪些方面是重要的,它常常误解人类的示例,无法学习所需的任务。为了解决这个问题,我们强调——虽然机器人学习者可能不知道要关注什么——但人类教师知道。在本文中,我们提出人类主动用小型、轻量的信标标记其任务的关键部分。在我们的框架(RECON)下,人类在提供演示之前将这些信标附着在任务相关物体上:当人类展示任务示例时,信标跟踪被标记物体的位置。然后,我们利用这些离线信标数据来训练任务相关的状态嵌入。具体来说,我们将机器人的观察嵌入到一个与测量的信标读数相关的潜在状态中:在实践中,这导致机器人自主过滤掉无关观察,并基于从信标数据中学到的特征做出决策。我们的模拟和真实机器人实验表明,这种人工放置信标的框架可以减轻因果混淆。事实上,我们发现使用RECON显著减少了传达任务所需的演示次数,降低了人类教学所需的总时间。视频见:https://youtu.be/oy85xJvtLSU

关键词

引用

@article{arxiv.2409.13607,
  title  = {RECON: Reducing Causal Confusion with Human-Placed Markers},
  author = {Robert Ramirez Sanchez and Heramb Nemlekar and Shahabedin Sagheb and Cara M. Nunez and Dylan P. Losey},
  journal= {arXiv preprint arXiv:2409.13607},
  year   = {2025}
}

备注

7 pages, 5 figures