中文

ERMV:编辑 4D 机器人多视角图像以增强具身智能体

计算机视觉与模式识别 2025-07-24 v1

摘要

机器人仿照学习依赖于 4D 多视角序列图像。然而,数据收集成本高、高质量数据稀缺,严重限制了具身智能策略(如视觉语言动作 VLA 模型)的泛化与应用。数据增强是克服数据稀缺的强有力策略,但目前缺乏针对操控任务的 4D 多视角序列图像编辑方法。因此,我们提出了 ERMV(Editing Robotic Multi-View 4D data),一种新颖的数据增强框架,通过单帧编辑和机器人状态条件高效编辑整个多视角序列。这一任务包含三个核心挑战:(1) 在动态视角和长时间尺度上保持几何和视觉一致性;(2) 以低计算成本扩大编辑工作窗口;(3) 确保关键目标物体(如机器人机械臂)的语义完整性。ERMV 通过一系列创新措施解决了这些挑战。首先,为确保运动模糊的时空一致性,我们引入了新的 Epipolar Motion-Aware Attention (EMA-Attn) 机制,学习运动引起的像素位移后再应用几何约束。其次,为最大化编辑工作窗口,ERMV 首创稀疏时空 (Sparse Spatio-Temporal, STT) 模块,将时空和视角解耦,通过稀疏采样视角来重构单帧多视角问题,从而降低计算需求。最后,为缓解误差累积,我们引入反馈干预机制,使用多模态大语言模型 (MLLM) 检查编辑不一致性,仅在必要时请求针对性专家指导。大量实验表明,ERMV 生成的数据显著提升了 VLA 模型在模拟和真实环境中的鲁棒性和泛化能力。

关键词

引用

@article{arxiv.2507.17462,
  title  = {ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents},
  author = {Chang Nie and Guangming Wang and Zhe Lie and Hesheng Wang},
  journal= {arXiv preprint arXiv:2507.17462},
  year   = {2025}
}