中文

面向自回归视频扩散模型的误差分析:统一框架

计算机视觉与模式识别 2025-12-30 v2 多媒体

摘要

自回归视频扩散模型(AR-VDMs)在生成长篇逼真视频方面展现出强大能力,但存在两个关键局限:(i)历史遗忘,即模型在生成内容过程中丢失先前生成的片段;(ii)时间退化,即帧质量随时间恶化。然而,针对这些现象的严谨理论分析仍缺乏,现有经验性认识不足以支撑。本文引入 Meta-ARVDM,一个统一的分析框架,研究这两种误差因 AR-VDMs 的共享自回归结构。我们表明,历史遗忘由生成输出与前导帧之间的条件互信息决定,条件于输入;并证明,引入更多历史帧可单调减轻历史遗忘,从而理论上合理解释了现有研究中的常见信念。此外,我们的理论揭示,标准评估指标未能捕捉此效应,促使我们基于封闭式环境中“针对haystack 中的针”任务(DMLab 和 Minecraft)的新评估方案。我们进一步表明,时间退化可由每一步误差的累计和量化,进而预测不同调度器的退化程度,而无需视频 rollout。最终,我们的评估发现,历史遗忘与时间退化之间存在强大的经验相关性,这一以前未报道的联系被揭示出来。

关键词

引用

@article{arxiv.2503.10704,
  title  = {Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework},
  author = {Jing Wang and Fengzhuo Zhang and Xiaoli Li and Vincent Y. F. Tan and Tianyu Pang and Chao Du and Aixin Sun and Zhuoran Yang},
  journal= {arXiv preprint arXiv:2503.10704},
  year   = {2025}
}