将自监督表示适用于生成式潜空间
计算机视觉与模式识别
2026-04-22 v2
摘要
我们提出 Representation Tokenizer(RepTok),一个表示图像的生成式建模框架,仅使用一个来自自监督视觉变换器的连续潜标记。基于预训练的 SSL 编码器,我们仅微调语义标记嵌入,并与生成解码器联合训练,使用标准的流匹配目标。这种适配丰富了标记中包含与重建相关的低级细节,从而实现准确的图像重建。为保持原始 SSL 空间的有利几何结构,我们添加余弦相似度损失对适应后的标记进行正则化,确保潜空间保持平滑且适合生成。单标记表述解决了二维潜空间中的空间冗余问题,显著降低了训练成本。尽管方法简单且高效,RepTok 在基于类的条件 ImageNet 生成中仍达到有竞争力的结果,并自然地扩展到文本到图像合成,在极端有限的训练预算下,能够在 MS-COCO 上实现有竞争力的零样性能。我们的发现凸显了经过微调的 SSL 表示作为紧凑且高效潜空间用于高效生成建模的潜力。
引用
@article{arxiv.2510.14630,
title = {Adapting Self-Supervised Representations as a Latent Space for Efficient Generation},
author = {Ming Gui and Johannes Schusterbauer and Timy Phan and Felix Krause and Josh Susskind and Miguel Angel Bautista and Björn Ommer},
journal= {arXiv preprint arXiv:2510.14630},
year = {2026}
}
备注
ICLR 2026, Code: https://github.com/CompVis/RepTok