中文

SyncVP:用于同步多模态视频预测的联合扩散

计算机视觉与模式识别 2025-03-25 v1

摘要

预测未来视频帧对于决策系统至关重要,但仅凭RGB帧往往不足以充分捕捉现实世界的复杂性。为解决这一限制,我们提出了一个集成互补数据模态的多模态框架,用于同步视频预测(SyncVP),以增强未来预测的丰富性和准确性。SyncVP基于预训练的模态特定扩散模型,引入一种高效的时空跨注意力模块,以实现跨模态的有效信息共享。我们在标准基准数据集上评估SyncVP,包括Cityscapes和BAIR,采用深度作为额外模态。我们进一步在SYNTHIA上使用语义信息以及ERA5-Land上使用气候数据上Demonstrate了其对其他模态的泛化能力。值得注意的是,SyncVP在仅存在单一模态的情况下也实现了最先进的性能,显示现其鲁棒性及其广泛应用的潜力。

关键词

引用

@article{arxiv.2503.18933,
  title  = {SyncVP: Joint Diffusion for Synchronous Multi-Modal Video Prediction},
  author = {Enrico Pallotta and Sina Mokhtarzadeh Azar and Shuai Li and Olga Zatsarynna and Juergen Gall},
  journal= {arXiv preprint arXiv:2503.18933},
  year   = {2025}
}