NextFlow:统一顺序建模激活多模态理解与生成
计算机视觉与模式识别
2026-01-06 v1 人工智能
摘要
我们提出 NextFlow,一个在 6 万亿个交错文本-图像离散 token 上训练的统一解码器-only 自回归 transformer。通过在统一的视觉表征内采用统一的自回归架构,NextFlow 原生激活多模态理解和生成能力,解锁了图像编辑、交错内容和视频生成等能力。受益于不同模态的本质差异——文本严格顺序、图像本质层次化,我们保留文本的下一个 token 预测,但采用下一个尺度预测进行视觉生成。这一做法不同于传统的光栅扫描方法,使 1024x1024 图像仅需 5 秒即可生成——相较于其他 AR 模型快了数量级。我们通过稳健的训练配方来解决多尺度生成的不稳定性。此外,我们引入前缀调谋策略用于强化学习。实验表明,NextFlow 在统一模型方面实现 state-of-the-art 性能,并在视觉质量上与专门的扩散基线相称。
引用
@article{arxiv.2601.02204,
title = {NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation},
author = {Huichao Zhang and Liao Qu and Yiheng Liu and Hang Chen and Yangyang Song and Yongsheng Dong and Shikun Sun and Xian Li and Xu Wang and Yi Jiang and Hu Ye and Bo Chen and Yiming Gao and Peng Liu and Akide Liu and Zhipeng Yang and Qili Deng and Linjie Xing and Jiyang Liu and Zhao Wang and Yang Zhou and Mingcong Liu and Yi Zhang and Qian He and Xiwei Hu and Zhongqi Qi and Jie Shao and Zhiye Fu and Shuai Wang and Fangmin Chen and Xuezhi Chai and Zhihua Wu and Yitong Wang and Zehuan Yuan and Daniel K. Du and Xinglong Wu},
journal= {arXiv preprint arXiv:2601.02204},
year = {2026}
}
备注
Project page: https://github.com/ByteVisionLab/NextFlow