中文

UniMMVSR:面向级联视频超分辨率的统一多模态框架

计算机视觉与模式识别 2025-10-10 v1

摘要

级联视频超分辨率已成为一种引注技术,用于解耦合使用大型基础模型生成高分辨率视频的计算负担。然而,现有研究主要局限于文本到视频任务,未能利用文本之外的额外生成条件,这些条件对确保多模态视频生成的保真度至关重要。为此,我们提出 UniMMVSR,首个集成混合模态条件(包括文本、图像和视频)的统一生成式视频超分辨率框架。我们在潜在视频扩散模型中全面探索了条件注入策略、训练方案和数据混合技术。一个关键挑战是设计不同的条件构建和利用方法,以使模型能够精确利用所有条件类型,由于其与目标视频之间的关联性差异。我们的实验表明,UniMMVSR 显著优于现有方法,生成的视频细节更丰富且更符合多模态条件。我们还验证了将 UniMMVSR 与基础模型组合实现 4K 视频多模态引导生成的可行性,这是现有技术难以实现的。

关键词

引用

@article{arxiv.2510.08143,
  title  = {UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution},
  author = {Shian Du and Menghan Xia and Chang Liu and Quande Liu and Xintao Wang and Pengfei Wan and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2510.08143},
  year   = {2025}
}