中文

一致性保持的视频生成除错模型:DCDM

计算机视觉与模式识别 2026-02-17 v1

摘要

最近的视频生成模型在视觉保真度方面表现突出,但常在语义、几何和身份一致性方面存在挑战。本文提出一种系统级框架,称为Divide-and-Conquer Diffusion Model (DCDM),以解决三个关键挑战:(1)片内世界知识一致性,(2)片间相机一致性,(3)片中元素一致性。DCDM在这三种情形下分解视频一致性建模为三个专用组件,同时共享统一的视频生成主干。针对片内一致性,DCDM利用大型语言模型将输入提示解析为结构化语义表征,随后由扩散变换器将其转化为连贯的视频内容。针对片间相机一致性,我们提出了噪声空间中的时间相机表征,实现精确稳定的相机运动控制,并引入文本到图像初始化机制以进一步提升可控性。针对片中一致性,DCDM采用整体场景生成范式,采用窗口化跨注意力和稀疏片间自注意力,确保长程叙事连贯性同时保持计算效率。我们在AAAI'26 CVM Competition测试集上验证了该框架,结果表明所提出的策略有效解决了这些挑战。

关键词

引用

@article{arxiv.2602.13637,
  title  = {DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation},
  author = {Haoyu Zhao and Yuang Zhang and Junqi Cheng and Jiaxi Gu and Zenghui Lu and Peng Shu and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2602.13637},
  year   = {2026}
}

备注

7 pages, 2 figures