中文

兼收并蓄:融合语言模型与扩散模型进行视频生成

计算机视觉与模式识别 2025-04-30 v3 人工智能 计算与语言 机器学习

摘要

近期文本到视频 (T2V) 生成的进展由两种竞争范式驱动:自回归语言模型和扩散模型。然而,每种范式都有内在局限:语言模型在视觉质量和误差累积方面存在困难,而扩散模型缺乏语义理解和因果建模。在本工作中,我们提出 LanDiff,一个混合框架,通过粗到细的生成方式协同两种范式的优势。我们的架构引入了三项关键创新:(1) 一个语义标记器,通过高效的语义压缩将 3D 视觉特征压缩为紧凑的 1D 离散表示,实现约 14,000 倍的压缩比;(2) 一个语言模型,用于生成具有高层语义关系的语义标记;(3) 一个流式扩散模型,将粗粒度语义细化为高保真视频。实验表明,LanDiff(一个 5B 模型)在 VBench T2V 基准测试中取得 85.43 的分数,超越了最先进开源模型 Hunyuan Video (13B) 以及 Sora、Kling 和 Hailuo 等商业模型。此外,我们的模型在长视频生成方面也达到了最先进性能,超越了该领域的其他开源模型。我们的演示可在 https://landiff.github.io/ 查看。

关键词

引用

@article{arxiv.2503.04606,
  title  = {The Best of Both Worlds: Integrating Language Models and Diffusion Models for Video Generation},
  author = {Aoxiong Yin and Kai Shen and Yichong Leng and Xu Tan and Xinyu Zhou and Juncheng Li and Siliang Tang},
  journal= {arXiv preprint arXiv:2503.04606},
  year   = {2025}
}

备注

Our code is available at https://github.com/LanDiff/LanDiff