中文

UniVid:用于高质量视频生成的金字塔扩散模型

计算机视觉与模式识别 2026-03-17 v1 人工智能 多媒体

摘要

基于扩散的文本到视频(T2V)或图像到视频(I2V)生成方法日益受到关注,但目前在将两种生成范式统一到单一模型中仍面临挑战。本文提出一种统一视频生成模型(UniVid),采用文本提示和参考图像的混合条件。给定这两种控制方式,模型可从文本提示中提取物体的外观及其运动描述,同时从图像线索获取纹理细节和结构信息,以指导视频生成过程。具体而言,我们通过引入时序金字塔跨帧空间-时序注意力模块和卷积,将预训练的文本到图像扩散模型扩展到生成具有时序一致性的帧。为支持双模态控制,我们引入双流跨注意力机制,其注意力得分可在推理时自由地进行单模态或双模态控制之间的插值。大量实验表明,UniVid 在 T2V、I2V 和(T+I)2V 任务上实现了优异的时序一致性。

关键词

引用

@article{arxiv.2603.13739,
  title  = {UniVid: Pyramid Diffusion Model for High Quality Video Generation},
  author = {Xinyu Xiao and Binbin Yang and Tingtian Li and Yipeng Yu and Sen Lei},
  journal= {arXiv preprint arXiv:2603.13739},
  year   = {2026}
}