中文

将自监督表示适用于生成式潜空间

计算机视觉与模式识别 2026-04-22 v2

摘要

我们提出 Representation Tokenizer(RepTok),一个表示图像的生成式建模框架,仅使用一个来自自监督视觉变换器的连续潜标记。基于预训练的 SSL 编码器,我们仅微调语义标记嵌入,并与生成解码器联合训练,使用标准的流匹配目标。这种适配丰富了标记中包含与重建相关的低级细节,从而实现准确的图像重建。为保持原始 SSL 空间的有利几何结构,我们添加余弦相似度损失对适应后的标记进行正则化,确保潜空间保持平滑且适合生成。单标记表述解决了二维潜空间中的空间冗余问题,显著降低了训练成本。尽管方法简单且高效,RepTok 在基于类的条件 ImageNet 生成中仍达到有竞争力的结果,并自然地扩展到文本到图像合成,在极端有限的训练预算下,能够在 MS-COCO 上实现有竞争力的零样性能。我们的发现凸显了经过微调的 SSL 表示作为紧凑且高效潜空间用于高效生成建模的潜力。

关键词

引用

@article{arxiv.2510.14630,
  title  = {Adapting Self-Supervised Representations as a Latent Space for Efficient Generation},
  author = {Ming Gui and Johannes Schusterbauer and Timy Phan and Felix Krause and Josh Susskind and Miguel Angel Bautista and Björn Ommer},
  journal= {arXiv preprint arXiv:2510.14630},
  year   = {2026}
}

备注

ICLR 2026, Code: https://github.com/CompVis/RepTok