中文

EMMA:基于生成式视觉迁移泛化真实世界机器人操作

人工智能 2026-03-17 v2 机器人学

摘要

视觉-语言-动作(VLA)模型的泛化严重依赖多样化的训练数据。然而,为不同物体外观下的机器人操作获取大规模数据成本高昂且费时费力。为解决这一局限性,我们提出了具身操作媒体自适应(EMMA),一个结合生成式数据引擎与高效训练流程的 VLA 策略增强框架。我们提出了 DreamTransfer,一种基于扩散 Transformer 的架构,用于生成多视角一致且具有几何基础的具身操作视频。DreamTransfer 通过提示词实现机器人视频的视觉编辑,允许在保持其 3D 结构和几何有效性的同时改变前景、背景和光照。我们还利用真实数据与生成数据的混合训练集,并提出 AdaMix 以增强训练过程。AdaMix 是一种根据策略性能自适应地对样本进行加权的训练策略,以强调困难样本。综合评估表明,DreamTransfer 生成的视频在多视角一致性、几何准确性和文本条件精度方面,相较于先前的视频生成技术有显著提升。我们在模拟和真实世界机器人环境中进行了总计超过 1800 次试验的广泛评估。在零样本视觉设置的真实世界机器人任务中,我们的框架相较于仅使用真实数据训练实现了超过 92% 的相对性能提升,并通过 AdaMix 进一步提升了 17%,证明了其在增强策略泛化方面的有效性。

关键词

引用

@article{arxiv.2509.22407,
  title  = {EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer},
  author = {Zhehao Dong and Xiaofeng Wang and Zheng Zhu and Yirui Wang and Yang Wang and Yukun Zhou and Boyuan Wang and Chaojun Ni and Runqi Ouyang and Wenkang Qin and Xinze Chen and Yun Ye and Guan Huang and Zhen Lu and Yue Yang},
  journal= {arXiv preprint arXiv:2509.22407},
  year   = {2026}
}