中文

LINA:基于连续 token 的线性自回归图像生成模型

计算机视觉与模式识别 2026-02-02 v1

摘要

基于连续 token 的自回归模型是视觉生成(尤其是文本到图像 T2I 合成)的有前景的范式,但因计算成本高昂而受到限制。我们研究如何在此框架内设计高效的线性注意力。具体而言,我们对不同设计选择下参数数量的比例行为进行系统实证分析,重点关注 (1) 线性注意力中的归一化范式(基于除法 vs. 基于减法)以及 (2) 用于局部性增强的深度卷积。我们的结果表明,尽管基于减法的归一化对图像分类有效,但基于除法的归一化在线性生成式 transformer 中更具扩展性。此外,融合卷积用于局部性建模在自回归生成中发挥关键作用,这与扩散模型的发现相符。我们进一步将常见于因果线性注意力中的门控机制扩展到双向设置,提出 KV gate。通过引入数据无关的可学习参数至 key 与 value 状态,KV gate 为每个 token 分配记忆权重,实现类似语言模型中遗忘门的灵活记忆管理。基于上述发现,我们构建 LINA——一个完全基于线性注意力的简单且高效 T2I 模型,能够从用户指令生成高保真 1024x1024 图像。LINA 在 class-conditional 与 T2I 基准测试中表现出竞争力,ImageNet 上达 2.18 FID(约 14 亿参数),GenEval 上达 0.74(约 15 亿参数)。单个线性注意力模块相较于 softmax 注意力约降低 61% 的 FLOPs。代码与模型已发布于:https://github.com/techmonsterwang/LINA。

关键词

引用

@article{arxiv.2601.22630,
  title  = {LINA: Linear Autoregressive Image Generative Models with Continuous Tokens},
  author = {Jiahao Wang and Ting Pan and Haoge Deng and Dongchen Han and Taiqiang Wu and Xinlong Wang and Ping Luo},
  journal= {arXiv preprint arXiv:2601.22630},
  year   = {2026}
}

备注

20 pages, 9 figures