中文

基于表示自编码器的改进基线

计算机视觉与模式识别 2026-05-19 v1 人工智能 图形学 机器学习 机器学习

摘要

表示自编码器(RAE)用预训练的视觉编码器取代了传统的 VAE。在本文中,我们系统地研究了几个设计选择,并发现了三个可简化和改进 RAE 的见解。首先,我们研究了一种广义公式,其中表示定义为最后 k 个编码器层的总和,而不仅仅是最后一层。这一简单的改变极大地改善了重建效果,且无需编码器微调或专用数据(例如文本、人脸)。其次,我们研究了普遍的假设,即 RAE(使用预训练表示作为编码器)取代了表示对齐(REPA),后者将相同的表示蒸馏到中间层。通过大规模实证分析,我们揭示了一个令人惊讶的发现:RAE 和 REPA 表现出互补的工作机制,允许将相同的表示同时用作中间扩散层的编码器和目标。最后,原始的 RAE 难以处理无分类器引导(CFG),并且需要训练第二个较弱的扩散模型用于 AutoGuidance (AG)。我们表明 REPA 本身可以被视为 RAE 潜空间中的 x-prediction。通过简单地重新参数化 DiT 模型的输出,它可以提供“免费”的引导。总体而言,RAEv2 的收敛速度比原始 RAE 快 10 倍以上,在 ImageNet-256 上仅用 80 个 epoch 即实现了 1.06 的 SOTA gFID。在 FDr^k 上,RAEv2 仅在 80 个 epoch 即实现了 2.17 的 SOTA,而无需任何训练后处理,相比之下先前的最佳结果为 3.26(800 个 epoch)。这促使我们采用 EP_FID@k(达到无引导 gFID <= k 的 epoch 数)作为训练效率的衡量标准。RAEv2 达到了 35 个 epoch 的 EP_FID@2,而原始 RAE 为 177 个 epoch。我们还在文本到图像生成和导航世界模型的多种设置中验证了我们的方法,显示出一致的改进。代码可在 https://raev2.github.io 获取。

关键词

引用

@article{arxiv.2605.18324,
  title  = {Improved Baselines with Representation Autoencoders},
  author = {Jaskirat Singh and Boyang Zheng and Zongze Wu and Richard Zhang and Eli Shechtman and Saining Xie},
  journal= {arXiv preprint arXiv:2605.18324},
  year   = {2026}
}