中文

ManipDreamer3D:基于占用感知3D轨迹的合成式合理机器人操作视频

机器人学 2025-11-14 v2 人工智能 计算机视觉与模式识别

摘要

数据稀缺仍然是机器人操作领域的重大挑战。虽然扩散模型为生成机器人操作视频提供了有前景的解决方案,但现有方法主要依赖2D轨迹,这本质上存在3D空间模糊性问题。在本工作中,我们提出了一个名为ManipDreamer3D的新框架,用于从输入图像和文本指令生成合理的3D感知机器人操作视频。我们的方法结合了3D轨迹规划与从第三人称视角重建的3D占用图,以及一种新颖的轨迹到视频扩散模型。具体而言,ManipDreamer3D首先从输入图像重建3D占用表示,然后计算优化的3D末端执行器轨迹,在最小化路径长度的同时避免碰撞。接下来,我们采用潜在编辑技术,从初始图像潜变量和优化后的3D轨迹创建视频序列。该过程使我们的专门训练的轨迹到视频扩散模型能够生成机器人抓取与放置视频。我们的方法生成具有自主规划的合理3D轨迹的机器人视频,显著减少了人工干预需求。实验结果表明,与现有方法相比,我们的方法在视觉质量上具有优势。

关键词

引用

@article{arxiv.2509.05314,
  title  = {ManipDreamer3D : Synthesizing Plausible Robotic Manipulation Video with Occupancy-aware 3D Trajectory},
  author = {Ying Li and Xiaobao Wei and Xiaowei Chi and Yuming Li and Zhongyu Zhao and Hao Wang and Ningning Ma and Ming Lu and Sirui Han and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2509.05314},
  year   = {2025}
}

备注

7pages; 7figures; 3 tables