MixAR:混合自回归图像生成
计算机视觉与模式识别
2025-11-18 v1 机器学习
摘要
自回归(AR)方法将图像表示为离散 token 的序列,这些 token 来自有限码本,已在图像生成中取得显著成功。然而,量化过程和有限码本大小不可避免地丢弃细粒度信息,导致生成保真度受限。受这一限制启发,近期研究探索了在连续潜空间上的自回归建模,提供更高的生成质量。然而,与受固定码本约束的离散 token 不同,连续表示位于广阔且无结构的空间中,这为高效自回归建模带来了显著挑战。为此,我们引入 MixAR,一种新型框架,利用混合训练范式将离散 token 作为先验指导连续 AR 建模。MixAR 是一种分解形式,利用离散 token 作为先验指导连续自回归预测。我们研究了多种离散-连续混合策略,包括自注意力(DC-SA)、交叉注意力(DC-CA)以及一种简单方法(DC-Mix),后者用信息丰富的离散标记取代同质化掩码标记。此外,为弥合训练时的真实 token 与推理时由预训练 AR 模型生成的 token 之间的差距,我们提出训练-推理混合(TI-Mix)以实现一致的训练和生成分布。在实验中,我们展示了 DC-Mix 策略在计算效率和生成保真度之间取得良好平衡,TI-Mix 能持续改善性能。
引用
@article{arxiv.2511.12181,
title = {MixAR: Mixture Autoregressive Image Generation},
author = {Jinyuan Hu and Jiayou Zhang and Shaobo Cui and Kun Zhang and Guangyi Chen},
journal= {arXiv preprint arXiv:2511.12181},
year = {2025}
}