中文

STARFlow2:桥接语言模型与归一化流以实现统一多模态生成

计算机视觉与模式识别 2026-05-11 v1 机器学习

摘要

深度生成模型在文本和视觉领域迅速发展,推动了能够理解、推理并生成交错文本-图像序列的统一多模态系统。大多数现有方法将自回归语言建模与基于扩散的图像生成器相结合,继承了因果文本生成与迭代视觉去噪之间的结构不匹配。我们观察到,自回归归一化流是自回归Transformer——共享与LLM相同的因果掩码、KV-cache机制和从左到右的结构——使其成为真正统一多模态生成的最自然范式。我们提出了STARFlow2,它建立在Pretzel架构之上,该架构通过残差跳跃连接将预训练的VLM流与TarFlow流垂直交错,两者都在相同的因果掩码下运行。结合深浅流设计和统一的FAE潜在空间,STARFlow2实现了缓存友好的交错生成,其中文本和视觉输出都直接进入KV-cache,无需重新编码。实验在图像生成和多模态理解基准上展示了强大的性能,验证了自回归流作为统一多模态建模的可行基础。

关键词

引用

@article{arxiv.2605.08029,
  title  = {STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation},
  author = {Ying Shen and Tianrong Chen and Yuan Gao and Yizhe Zhang and Yuyang Wang and Miguel Ángel Bautista and Shuangfei Zhai and Joshua M. Susskind and Jiatao Gu},
  journal= {arXiv preprint arXiv:2605.08029},
  year   = {2026}
}

备注

19 pages, 9 figures