CoVAR:基于多模态扩散的机器人操控视频-动作共生
计算机视觉与模式识别
2025-12-19 v1
摘要
我们提出了一种从初始图像观察和机器人关节状态出发,生成遵循文本指令的视频-动作对的方法。我们的 approach 自动为视频扩散模型提供动作标签,克服了常见的动作标注缺失,使其能够充分用于机器人策略学习。现有方法要么采用两阶段管道,这限制了紧密的跨模态信息共享,要么依赖单模态扩散模型适配联合分布,无法充分利用预训练视频知识。为克服这些限制,我们(1)扩展了预训练视频扩散模型,引入平行且专用的动作扩散模型以保留预训练知识,(2)引入桥接注意力机制以实现有效的跨模态交互,(3)设计动作细化模块将粗糙动作转换为低分辨率数据集上的精确控制。广泛的在多个公开基准和真实世界数据集上的评估表明,我们的方法生成的视频质量更高,动作更准确,且显著优于现有基线,为利用大规模视频数据进行机器人学习提供了可扩展框架。
引用
@article{arxiv.2512.16023,
title = {CoVAR: Co-generation of Video and Action for Robotic Manipulation via Multi-Modal Diffusion},
author = {Liudi Yang and Yang Bai and George Eskandar and Fengyi Shen and Mohammad Altillawi and Dong Chen and Ziyuan Liu and Abhinav Valada},
journal= {arXiv preprint arXiv:2512.16023},
year = {2025}
}
备注
9 pages, 7 figures