中文

UniVidX:基于扩散先验的统一多模态视频生成框架

计算机视觉与模式识别 2026-05-04 v1

摘要

最近的进展表明,视频扩散模型(VDMs)可被 repurposed 用于多样化的多模态图形任务。然而,现有方法常在每个问题设置下训练独立模型,固定输入输出映射,限制跨模态关联的建模。我们提出UniVidX,一个统一的多模态框架,利用VDM先验实现灵活的视频生成。UniVidX 将像素对齐任务表述为共享多模态空间中的条件生成,适应各模态特定分布,同时保留骨干网络的原生先验,并在合成过程中促进跨模态一致性。它建立在三个关键设计之上。随机条件遮蔽(SCM)在训练期间随机划分模态为干净条件和噪声目标,实现而非固定映射的全向条件生成。解耦门控LoRA(DGL)引入各模态专属LoRA,当模态作为生成目标时激活,保留VDM的强先验。在跨模态自注意力(CMSA)中,跨模态共享键和值,同时保持模态特定查询,促进信息交换和跨模态对齐。我们在两个领域实现UniVidX:UniVid-Intrinsic 用于RGB视频及其内在图(包括反照率、 irradiance 和法线);UniVid-Alpha 用于混合RGB视频及其组成RGBA图层。实验表明,两个模型在不同任务上均达到与SOTA方法相当的性能,并对野外场景具有稳健的泛化能力,即便仅训练少于1000个视频。项目页面:https://houyuanchen111.github.io/UniVidX.github.io/

关键词

引用

@article{arxiv.2605.00658,
  title  = {UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors},
  author = {Houyuan Chen and Hong Li and Xianghao Kong and Tianrui Zhu and Shaocong Xu and Weiqing Xiao and Yuwei Guo and Chongjie Ye and Lvmin Zhang and Hao Zhao and Anyi Rao},
  journal= {arXiv preprint arXiv:2605.00658},
  year   = {2026}
}

备注

Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)