中文

MixAR:混合自回归图像生成

计算机视觉与模式识别 2025-11-18 v1 机器学习

摘要

自回归(AR)方法将图像表示为离散 token 的序列,这些 token 来自有限码本,已在图像生成中取得显著成功。然而,量化过程和有限码本大小不可避免地丢弃细粒度信息,导致生成保真度受限。受这一限制启发,近期研究探索了在连续潜空间上的自回归建模,提供更高的生成质量。然而,与受固定码本约束的离散 token 不同,连续表示位于广阔且无结构的空间中,这为高效自回归建模带来了显著挑战。为此,我们引入 MixAR,一种新型框架,利用混合训练范式将离散 token 作为先验指导连续 AR 建模。MixAR 是一种分解形式,利用离散 token 作为先验指导连续自回归预测。我们研究了多种离散-连续混合策略,包括自注意力(DC-SA)、交叉注意力(DC-CA)以及一种简单方法(DC-Mix),后者用信息丰富的离散标记取代同质化掩码标记。此外,为弥合训练时的真实 token 与推理时由预训练 AR 模型生成的 token 之间的差距,我们提出训练-推理混合(TI-Mix)以实现一致的训练和生成分布。在实验中,我们展示了 DC-Mix 策略在计算效率和生成保真度之间取得良好平衡,TI-Mix 能持续改善性能。

关键词

引用

@article{arxiv.2511.12181,
  title  = {MixAR: Mixture Autoregressive Image Generation},
  author = {Jinyuan Hu and Jiayou Zhang and Shaobo Cui and Kun Zhang and Guangyi Chen},
  journal= {arXiv preprint arXiv:2511.12181},
  year   = {2025}
}