中文

Vidarc:用于闭环控制的具象化视频扩散模型

机器人学 2025-12-22 v1 机器学习

摘要

在数据稀缺的 setting 中,机器人臂操作是一项极具挑战性的任务 due to complex embodiment dynamics and diverse contexts。最近的基于视频的方法在通过在互联网规模的视频数据中进行预训练,捕捉和传递时序和物理互动方面显示出巨大的潜力。然而,这些方法通常不针对具象化-specific 闭环控制进行优化,通常 suffer from high latency and insufficient grounding。本文提出了 Vidarc(Video Diffusion for Action Reasoning and Closed-loop Control),一种增强 by masked inverse dynamics model 的自回归具象化视频扩散方法。通过将视频预测 grounding with action-relevant masks,并通过缓存的自回归生成 incorporating real-time feedback,Vidarc 实现了快速、准确的闭环控制。在 100 万 cross-embodiment episodes 上进行预训练后,Vidarc 超过了最先进的基线方法,在实际部署中实现了至少 15% 的成功率提高,并将延迟降低了 91%。我们还强调了其在 previously unseen robotic platforms 上的 robust generalization 和 error correction capabilities。

关键词

引用

@article{arxiv.2512.17661,
  title  = {Vidarc: Embodied Video Diffusion Model for Closed-loop Control},
  author = {Yao Feng and Chendong Xiang and Xinyi Mao and Hengkai Tan and Zuyue Zhang and Shuhe Huang and Kaiwen Zheng and Haitian Liu and Hang Su and Jun Zhu},
  journal= {arXiv preprint arXiv:2512.17661},
  year   = {2025}
}