TC-IDM:面向可执行零样本机器人运动的视频生成接地
机器人学
2026-01-27 v1
摘要
视觉-语言-动作(VLA)范式通过利用视觉-语言模型实现了强大的机器人控制,但其对大规模、高质量机器人数据的依赖限制了其泛化能力。生成式世界模型为通用具身智能提供了一种有前景的替代方案,但其像素级计划与物理可执行动作之间仍存在关键差距。为此,我们提出了以工具为中心的逆动力学模型(TC-IDM)。通过聚焦由世界模型合成的工具想象轨迹,TC-IDM 建立了一个鲁棒的中间表示,弥合了视觉规划与物理控制之间的差距。TC-IDM 通过对生成视频进行分割和 3D 运动估计来提取工具的点云轨迹。考虑到多样的工具属性,我们的架构采用解耦的动作头,将这些规划轨迹投影为 6 自由度末端执行器运动及相应的控制信号。这种“规划-转译”范式不仅支持广泛的末端执行器,还显著改善了视角不变性。此外,它在长时序和分布外任务中表现出强大的泛化能力,包括与可变形物体的交互。在真实世界评估中,带有 TC-IDM 的世界模型实现了 61.11% 的平均成功率,其中简单任务成功率为 77.7%,零样本可变形物体任务成功率为 38.46%。它显著优于端到端 VLA 风格的基线和其他逆动力学模型。
引用
@article{arxiv.2601.18323,
title = {TC-IDM: Grounding Video Generation for Executable Zero-shot Robot Motion},
author = {Weishi Mi and Yong Bao and Xiaowei Chi and Xiaozhu Ju and Zhiyuan Qin and Kuangzhi Ge and Kai Tang and Peidong Jia and Shanghang Zhang and Jian Tang},
journal= {arXiv preprint arXiv:2601.18323},
year = {2026}
}