Lumos-1:基于统一模型视角的自回归视频生成中的离散扩散
摘要
自回归大语言模型(LLM)已统一了广泛的语言任务,激发了自回归(AR)视频生成的初步工作。现有的 AR 视频生成器要么偏离标准 LLM 架构,要么依赖笨重的外部文本编码器,要么因下一个标记解码而产生不可接受的延迟。本文引入 Lumos-1,一个基于 LLM 的统一模型,用于高效离散扩散的 AR 视频生成。首先,为了适配 LLM 处理视频,我们发现 1D RoPE 不适合用于视觉时空相关性建模,而虽然已证明有用,却呈现不平衡频率谱的朴素 3D RoPE 也存在问题。因此,我们提出 MM-RoPE,在保留原始文本 RoPE 的同时,无缝适配视频数据,涵盖全面的频率谱和缩放后的 3D 位置。其次,为了适应视频数据特性并克服下一个标记解码的低效问题,我们采用基于掩码的并行离散扩散,结合帧内双向和帧间因果注意力掩码。基于该注意力掩码,我们发现由于空间信息冗余导致的帧级损失不平衡问题,并提出自回归离散扩散强制(Autoregressive Discrete Diffusion Forcing),在训练期间引入时间管道掩码,并配合推理时的兼容掩码策略以避免质量下降。尽管仅使用 48 块 GPU 进行预训练和微调,Lumos-1 仍在 GenEval、COSMOS-Video2World 和 OpenSoraPlan 等基准测试上超越了 Show-o2、VBench-I2V 和 VBench-T2V。代码和模型已在 https://github.com/alibaba-damo-academy/Lumos 提供。
关键词
引用
@article{arxiv.2507.08801,
title = {Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective},
author = {Hangjie Yuan and Weihua Chen and Jun Cen and Hu Yu and Jingyun Liang and Shuning Chang and Zhihui Lin and Tao Feng and Pengwei Liu and Jiazheng Xing and Hao Luo and Jiasheng Tang and Fan Wang and Yi Yang},
journal= {arXiv preprint arXiv:2507.08801},
year = {2026}
}
备注
ICLR 2026 Camera Ready Version. Code and Models: https://github.com/alibaba-damo-academy/Lumos