利用协同轨迹控制学习机器人操作的视频生成
计算机视觉与模式识别
2026-01-28 v3
摘要
视频扩散模型的最新进展在生成机器人决策数据方面展现出前景,轨迹条件进一步实现了细粒度控制。然而,现有方法主要关注单个物体运动,难以捕捉复杂操作中至关重要的多物体交互。这一局限性源于重叠区域的纠缠特征,导致视觉保真度下降。为了解决这个问题,我们提出了 RoboMaster,一种通过协同轨迹公式对物体间动力学进行建模的新框架。与先前分解物体的方法不同,我们的核心是将交互过程分解为三个子阶段:交互前、交互中和交互后,并使用主导物体对每个阶段进行建模,具体而言,在交互前和交互后阶段是机械臂,在交互期间是被操作物体。这种设计有效缓解了先前工作中多物体特征融合的问题。为了进一步确保视频中主体的语义一致性,我们为物体引入了外观和形状感知的潜在表示。在具有挑战性的 Bridge 数据集以及 RLBench 和 SIMPLER 基准上的大量实验表明,我们的方法在用于机器人操作的轨迹控制视频生成中确立了新的最先进性能。项目页面:https://fuxiao0719.github.io/projects/robomaster/
引用
@article{arxiv.2506.01943,
title = {Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control},
author = {Xiao Fu and Xintao Wang and Xian Liu and Jianhong Bai and Runsen Xu and Pengfei Wan and Di Zhang and Dahua Lin},
journal= {arXiv preprint arXiv:2506.01943},
year = {2026}
}
备注
ICLR 2026. Project Page: https://fuxiao0719.github.io/projects/robomaster/