从仿真中看真实感:视觉语言动作数据增强的高效视频迁移
计算机视觉与模式识别
2026-05-05 v1 机器人学
摘要
视觉语言动作 (VLA) 模型通常依赖大规模真实世界视频,而仿真数据虽然具有收集成本低、高度可并行的优势,却因视觉领域差距大、环境多样性有限,导致实际应用中的泛化能力较弱。我们提出了一种高效的视频增强框架,将仿真 VLA 视频转换为保持任务语义和动作轨迹的真实训练视频。该框架通过视频语义分割和视频描述生成从仿真中提取结构化条件,再改写描述以多样化环境,最后使用条件视频迁移模型合成真实视频。为实现大规模实用化,我们引入了 diffusion 特征复用机制,在相邻时间步之间复用视频 token 以加速生成,并提出核心集采样策略,在有限计算资源下识别出增强的紧凑、非冗余子集。在 Robotwin 2.0、LIBERO、LIBERO-Plus 以及实际机器人平台上的大量实验表明,我们的方法在 Robotwin 2.0 上使 RDT-1B 提升 8%,在更具挑战性的 LIBERO-Plus 基准上使 提升 5.1%。代码已公开:https://github.com/nanfangxiansheng/Seeing-Realism-from-Simulation。
引用
@article{arxiv.2605.02757,
title = {Seeing Realism from Simulation: Efficient Video Transfer for Vision-Language-Action Data Augmentation},
author = {Chenyu Hui and Xiaodi Huang and Siyu Xu and Yunke Wang and Shan You and Fei Wang and Tao Huang and Chang Xu},
journal= {arXiv preprint arXiv:2605.02757},
year = {2026}
}
备注
ICML 2026