中文

统一视频动作模型

机器人学 2025-04-28 v3 计算机视觉与模式识别

摘要

统一的视频和动作模型在机器人领域具有巨大的潜力,因为视频提供丰富的场景信息用于动作预测,而动作则为视频预测提供了动态信息。然而,有效地结合视频生成和动作预测仍然具有挑战性,当前的基于视频生成的方法在动作准确度和推理速度方面尚未达到直接策略学习的性能水平。为弥合这一差距,我们引入了统一视频动作模型(UVA),该模型联合优化视频和动作预测,以实现高准确度和高效动作推理。其关键在于学习联合视频-动作潜表征并进行视频-动作解耦。联合潜表征桥接了视觉和动作领域,有效地建模了视频和动作序列之间的关系。而解耦式解码器由两个轻量级扩散头驱动,可在推理时绕过视频生成,从而实现高速动作推理。这种统一框架进一步通过掩码输入训练实现了多功能性。通过对比掩码动作或视频,单个模型可以解决除策略学习之外的各种任务,如前向和逆向动力学建模和视频生成。通过一系列广泛实验,我们展示了UVA可作为通用解答 solution for a wide range of robotics tasks,包括策略学习、前向/逆向动力学和视频观察预测, without compromising performance compared to methods tailored for specific applications. 结果可在 https://unified-video-action-model.github.io/ 查看。

关键词

引用

@article{arxiv.2503.00200,
  title  = {Unified Video Action Model},
  author = {Shuang Li and Yihuai Gao and Dorsa Sadigh and Shuran Song},
  journal= {arXiv preprint arXiv:2503.00200},
  year   = {2025}
}

备注

Project website: https://unified-video-action-model.github.io/