HiAR:基于层次去噪的高效自回归长视频生成
计算机视觉与模式识别
2026-03-10 v1
摘要
自回归 (AR) 扩散为生成理论上无限长度的视频提供了有前景的框架。然而,一个主要挑战是在保持时间连续性的同时防止因误差累积而导致的渐进式质量下降。为确保连续性,现有方法通常以高度去噪的上下文为条件;然而,这种做法会以高置信度传播预测误差,从而加剧降解。在本文中,我们认为高度干净的上下文并非必需。drawing inspiration from bidirectional diffusion models, which denoise frames at a shared noise level while maintaining coherence, 我们提出在当前块的噪声水平上进行条件处理,可为时间一致性提供充分信号,同时有效缓解误差传播。在此基础上,我们提出 HiAR,一种层次去噪框架,以颠倒常规生成顺序为基础:而不是按顺序完成每个块,它在每个去噪步骤中进行跨所有块的因果生成,以便每个块始终在噪声水平相同的上下文上进行条件处理。这种层次结构自然允许流水线并行推理,在我们的 4 步设置下实现约 1.8 倍的 wall-clock 加速。我们进一步观察到,在此范式下,自卷积蒸馏会放大内在的低运动捷径,这是 mode-seeking reverse-KL 目标所致。为抵消这一影响,我们在双向注意力模式中引入前向-KL 正则化器,该正则化器在不干扰蒸馏损失的情况下,保留运动多样性以进行因果推理。在 VBench (20s 生成) 上,HiAR 在整体得分和时间漂移方面均优于所有比较方法。
引用
@article{arxiv.2603.08703,
title = {HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising},
author = {Kai Zou and Dian Zheng and Hongbo Liu and Tiankai Hang and Bin Liu and Nenghai Yu},
journal= {arXiv preprint arXiv:2603.08703},
year = {2026}
}
备注
Project page: https://jacky-hate.github.io/HiAR/ Code: https://github.com/Jacky-hate/HiAR