中文

面向对应关系的模仿学习:基于3D条件的灵活视觉运动控制

机器人学 2025-12-08 v1

摘要

我们提出了面向对应关系的模仿学习(Correspondence-Oriented Imitation Learning, COIL),这是一种用于视觉运动控制的条件策略学习框架,具备3D空间中的灵活任务表示。我们的 метод的核心在于,每个任务由选取场景中物体关键点的意图运动所定义。不同于假设固定数量的关键点或均匀分布的时间间隔,COIL 支持具有可变空间和时间细节的任务规范,能够适应不同的用户意图和任务需求。为稳健地将这种对应关系导向的任务表示 grounding 到动作中,我们设计了一种具有时空注意力机制的条件策略,有效地跨越多个输入模态进行信息融合。该策略通过可扩展的自监督训练管道实现,利用仿真环境中收集的演示数据进行训练,演示数据的对应标签在事后自动生成。COIL 在不同任务、物体和运动模式之间具备良好的跨域泛化能力,相较于先前的方法,在稠密和稀疏任务规范下均在真实世界的操控任务中实现了卓越的性能。

关键词

引用

@article{arxiv.2512.05953,
  title  = {Correspondence-Oriented Imitation Learning: Flexible Visuomotor Control with 3D Conditioning},
  author = {Yunhao Cao and Zubin Bhaumik and Jessie Jia and Xingyi He and Kuan Fang},
  journal= {arXiv preprint arXiv:2512.05953},
  year   = {2025}
}