RAE-AR: 用表示自动编码器驯服自回归模型
人工智能
2026-04-03 v1
摘要
生成模型的潜在空间长期以VAE编码器为主导。来自预训练表示编码器(如DINO、SigLIP、MAE)的潜在向量曾被认为不适合用于生成建模。最近,RAE方法的出现为表示自动编码器也能在VAE编码器上实现竞争性能提供了希望。然而,将表示自动编码器集成到连续自回归(AR)模型中,仍然 largely 未被探索。在本工作中,我们研究了在AR范式中采用高维表示自动编码器的挑战,即\textit{RAE-AR}。我们聚焦于AR模型的独特特性,并识别出两大主要障碍:复杂的逐token分布建模和高维度放大的训练-推断鸿沟(曝光偏差)。为此,我们通过分布归一化实现token简化以缓解建模难度并提高收敛性。此外,通过在训练期间引入高斯噪声注入来增强预测鲁棒性,以缓解曝光偏差。我们的实验结果表明,这些修改显著缩小了性能鸿沟,使表示自动编码器能够在AR模型上实现相当于传统VAE的性能。本工作为视觉理解与生成建模的统一架构铺平了道路。
引用
@article{arxiv.2604.01545,
title = {RAE-AR: Taming Autoregressive Models with Representation Autoencoders},
author = {Hu Yu and Hang Xu and Jie Huang and Zeyue Xue and Haoyang Huang and Nan Duan and Feng Zhao},
journal= {arXiv preprint arXiv:2604.01545},
year = {2026}
}