自回归视频扩散模型的自适应视频起始令牌
计算机视觉与模式识别
2025-11-18 v1
摘要
近期扩散式视频生成技术的发展,已产生令人印象深刻且高保真的短视频。为将这些成果拓展至生成连贯长视频,大多数视频扩散模型(VDMs)以自回归方式生成视频,即在前一帧条件下生成后续帧。通常存在两种主要范式:块状扩展与流式去噪。前者直接拼接前置干净帧作为条件, suffers from denoising latency and error accumulation(去噪延迟与误差累积)。后者维持去噪序列,噪声水平单调递增。在每一次去噪迭代中,生成一帧干净帧的同时,同时追加一帧新纯噪声,实现实时流式采样。然而,它们在一致性脆弱性和运动动力学方面表现不佳。本文提出自适应视频起始令牌(ada-BOV)用于自回归VDMs。BOV令牌是VDMs上的特殊可学习嵌入,它通过类似自适应层归一化的调制机制自适应地吸收去噪后的前导帧。该设计在保持全局一致性的同时,允许在动态场景中灵活地进行条件化。为确保调制BOV令牌所必需的局部动力学质量,我们进一步提出一种用于流式去噪的细化策略。该策略将采样轨迹长度与注意力窗口大小约束相分离,从而实现更好的局部引导和整体图像质量提升。我们还提出一种扰动增强训练噪声计划,平衡流式去噪的收敛速度与模型鲁棒性。大量实验表明,我们的方法在多项指标上实现了令人瞩目的定性和定量结果。
引用
@article{arxiv.2511.12099,
title = {Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models},
author = {Tianle Cheng and Zeyan Zhang and Kaifeng Gao and Jun Xiao},
journal= {arXiv preprint arXiv:2511.12099},
year = {2025}
}