通过构建正向配对实现表示学习与图像合成的高效统一
计算机视觉与模式识别
2025-05-21 v3 人工智能
摘要
虽然表示学习与生成建模均旨在理解视觉数据,但二者的统一仍未被探索。近期的统一自监督学习(Unified SSL)方法开始尝试弥合两者之间的差距。然而,这些方法仅依赖语义标记重建,需额外的 tokenizer 进行训练——引入显著计算开销。本文引入 Sorcen,一种 novel unified SSL 框架,融合协同对比-重建目标。我们的对比目标“Echo Contrast”利用 Sorcen 的生成能力,消除训练中额外图像裁剪或数据增强的需求。Sorcen 在语义标记空间中“生成”一个回声样本,形成对比正负配对。Sorcen 仅依赖预计算的标记,无需在训练期间进行在线标记转换,从而显著降低计算开销。在 ImageNet-1k 上进行的广泛实验表明,Sorcen 在线性探测、无条件图像生成、few-shot学习和迁移学习方面分别超越前 Unified SSL SoTA 0.4%、1.48 FID、1.76%和1.53%,同时计算效率提升 60.8%。此外,Sorcen 超越了前 single-crop MIM SoTA 在线性探测中取得优异成绩,并在无条件图像生成中实现 SoTA 性能,凸显了 Unified SSL 模型在性能与效率上的显著突破。
引用
@article{arxiv.2503.15060,
title = {Conjuring Positive Pairs for Efficient Unification of Representation Learning and Image Synthesis},
author = {Imanol G. Estepa and Jesús M. Rodríguez-de-Vera and Ignacio Sarasúa and Bhalaji Nagarajan and Petia Radeva},
journal= {arXiv preprint arXiv:2503.15060},
year = {2025}
}
备注
The source code is available in https://github.com/ImaGonEs/Sorcen