中文

TraceGen:基于 3D 轨迹空间的世界建模实现跨机体视频学习

机器人学 2025-11-27 v1 计算机视觉与模式识别 机器学习

摘要

仅凭少量演示,在新平台和新场景下学习新机器人任务仍具挑战性。虽然人类和不同机器人的视频资源丰富,但由于机体、摄像头及环境差异,难以直接利用这些视频。我们通过引入一种统一的符号表示——场景级轨迹的紧凑 3D "轨迹空间"(trace-space),实现从跨机体、跨环境、跨任务视频中进行学习。我们提出 TraceGen,这是一种在轨迹空间而非像素空间预测未来运动的世界模型,通过抽象化外观,保留操作所需的几何结构。为大规模训练 TraceGen,我们开发 TraceForge 数据管道,将异构的人类和机器人视频转化为一致的 3D 轨迹,构建包含 123K 条视频和 180 万条观测-轨迹-语言三元组的语料库。预训练后,TraceGen 获得可迁移的 3D 运动先验,适配效率极高:仅需 5 条目标机器人视频即可实现 4 项任务 80% 的成功率,推理速度比最新视频基模型快 50-600 倍。在更具挑战性的情形——仅提供 5 条手持手机拍摄的未标定人类演示视频时——仍能在真实机器人上达到 67.5% 的成功率,凸显 TraceGen 能否在无需目标检测或重型像素空间生成的情况下,跨机体高效适配。

关键词

引用

@article{arxiv.2511.21690,
  title  = {TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos},
  author = {Seungjae Lee and Yoonkyo Jung and Inkook Chun and Yao-Chih Lee and Zikui Cai and Hongjia Huang and Aayush Talreja and Tan Dat Dao and Yongyuan Liang and Jia-Bin Huang and Furong Huang},
  journal= {arXiv preprint arXiv:2511.21690},
  year   = {2025}
}