中文

CoVAR:基于多模态扩散的机器人操控视频-动作共生

计算机视觉与模式识别 2025-12-19 v1

摘要

我们提出了一种从初始图像观察和机器人关节状态出发,生成遵循文本指令的视频-动作对的方法。我们的 approach 自动为视频扩散模型提供动作标签,克服了常见的动作标注缺失,使其能够充分用于机器人策略学习。现有方法要么采用两阶段管道,这限制了紧密的跨模态信息共享,要么依赖单模态扩散模型适配联合分布,无法充分利用预训练视频知识。为克服这些限制,我们(1)扩展了预训练视频扩散模型,引入平行且专用的动作扩散模型以保留预训练知识,(2)引入桥接注意力机制以实现有效的跨模态交互,(3)设计动作细化模块将粗糙动作转换为低分辨率数据集上的精确控制。广泛的在多个公开基准和真实世界数据集上的评估表明,我们的方法生成的视频质量更高,动作更准确,且显著优于现有基线,为利用大规模视频数据进行机器人学习提供了可扩展框架。

关键词

引用

@article{arxiv.2512.16023,
  title  = {CoVAR: Co-generation of Video and Action for Robotic Manipulation via Multi-Modal Diffusion},
  author = {Liudi Yang and Yang Bai and George Eskandar and Fengyi Shen and Mohammad Altillawi and Dong Chen and Ziyuan Liu and Abhinav Valada},
  journal= {arXiv preprint arXiv:2512.16023},
  year   = {2025}
}

备注

9 pages, 7 figures