中文

面向仿真与真实策略协同训练的可泛化域自适应

机器人学 2026-01-19 v3 人工智能

摘要

行为克隆在机器人操作方面展现出潜力,但在现实世界中大规模获取演示的成本高昂。虽然仿真数据提供了一种可扩展的替代方案,特别是随着自动演示生成的进步,但策略向现实世界的迁移受到各种仿真与真实域差距的阻碍。在本工作中,我们提出了一个统一的仿真与真实协同训练框架,用于学习可泛化的操作策略,该框架主要利用仿真,且仅需少量真实世界演示。我们方法的核心是学习域不变且与任务相关的特征空间。我们的关键洞察是,跨域对齐观测及其对应动作的联合分布比仅对齐观测(边缘分布)提供了更丰富的信号。我们通过在协同训练框架中嵌入一个最优传输(OT)启发的损失来实现这一点,并将其扩展为非平衡 OT 框架,以处理大量仿真数据与有限真实世界样本之间的不平衡。我们在具有挑战性的操作任务上验证了我们的方法,表明它能够利用丰富的仿真数据使真实世界成功率提高达 30%,甚至能泛化到仅在仿真中见过的场景。项目网页:https://ot-sim2real.github.io/。

关键词

引用

@article{arxiv.2509.18631,
  title  = {Generalizable Domain Adaptation for Sim-and-Real Policy Co-Training},
  author = {Shuo Cheng and Liqian Ma and Zhenyang Chen and Ajay Mandlekar and Caelan Garrett and Danfei Xu},
  journal= {arXiv preprint arXiv:2509.18631},
  year   = {2026}
}

备注

Accepted to NeurIPS 2025