中文

Loong:基于自回归语言模型生成分钟级长视频

计算机视觉与模式识别 2025-04-03 v2

摘要

在自然语言处理领域,自回归大型语言模型(LLM)已在生成连贯且长序列的 token 方面取得了巨大成功,而针对视频生成的自回归 LLM 探索仍仅限于生成几秒钟的短视频。本文深入分析了阻止基于自回归 LLM 的视频生成器生成长视频的挑战。基于观察和分析,我们提出了 Loong,一种新的自回归 LLM 基于视频的生成器,能够生成分钟级的长视频。具体而言,我们将文本 token 和视频 token 建模为统一的序列,用于自回归 LLM,并从头训练模型。我们提出了渐进式从短视频到长视频的训练方法,并引入损失重新加权方案,以缓解长视频训练中的损失不平衡问题。我们进一步探讨了推理策略,包括视频 token 重编码和采样策略,以降低推理过程中的误差累积。我们提出的 Loong 可训练 10 秒长视频,并能在文本提示条件下扩展到生成分钟级长视频,实验结果证明了这一点。更多样本请访问:https://yuqingwang1029.github.io/Loong-video。

关键词

引用

@article{arxiv.2410.02757,
  title  = {Loong: Generating Minute-level Long Videos with Autoregressive Language Models},
  author = {Yuqing Wang and Tianwei Xiong and Daquan Zhou and Zhijie Lin and Yang Zhao and Bingyi Kang and Jiashi Feng and Xihui Liu},
  journal= {arXiv preprint arXiv:2410.02757},
  year   = {2025}
}

备注

Project page: https://yuqingwang1029.github.io/Loong-video