ARLON:利用自回归模型增强扩散 Transformer 以生成长视频
计算机视觉与模式识别
2025-04-16 v3
摘要
文本到视频模型近期取得了快速且实质性的进展。然而,由于数据和计算资源的限制,生成具有丰富运动动态的长视频仍是一项重大挑战。为了生成高质量、动态且时间一致的长视频,本文提出了 ARLON,一个通过整合 AR 模型提供的粗略空间和长程时间信息来引导 DiT 模型,从而利用自回归模型增强扩散 Transformer 以生成长视频的新框架。具体而言,ARLON 包含几项关键创新:1) 潜在向量量化变分自编码器(VQ-VAE)将 DiT 模型的输入潜在空间压缩为紧凑的视觉 token,桥接 AR 和 DiT 模型并平衡学习复杂度与信息密度;2) 基于自适应归一化的语义注入模块将来自 AR 模型的粗略离散视觉单元整合到 DiT 模型中,确保在视频生成期间提供有效引导;3) 为了增强对 AR 推理引入噪声的容忍能力,DiT 模型在训练时结合了包含不确定性采样模块的更粗视觉潜在 token。实验结果表明,在从 VBench 中选取的 11 项指标中,ARLON 在其中 8 项上显著优于基线 OpenSora-V1.2,在动态程度和美学质量方面有显著提升,同时在其余三项上提供具有竞争力的结果,并加速了生成过程。此外,ARLON 在长视频生成中实现了 SOTA 性能。我们展示了对推理效率提升的详细分析,以及一个展示使用渐进式文本提示生成长视频的实际应用。ARLON 的演示请参见 http://aka.ms/arlon。
引用
@article{arxiv.2410.20502,
title = {ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation},
author = {Zongyi Li and Shujie Hu and Shujie Liu and Long Zhou and Jeongsoo Choi and Lingwei Meng and Xun Guo and Jinyu Li and Hefei Ling and Furu Wei},
journal= {arXiv preprint arXiv:2410.20502},
year = {2025}
}
备注
Accepted at ICLR2025