基于生成式自增强技术的 Gen-SIS:提高自监督学习效果
计算机视觉与模式识别
2024-12-03 v1
摘要
自监督学习 (SSL) 方法通过训练图像编码器以最大化相同图像不同视图特征间的相似性,已成为强大的视觉表征学习方法。为完成这种视图不变性任务,当前 SSL 算法依赖手工设计的增强技术,如随机裁剪和颜色抖动,以创建图像的多个视图。最近的研究表明,生成式扩散模型可通过提供更丰富的数据增强来改善 SSL,但这些扩散模型需要在大规模图像-文本数据集上预训练,而许多专业领域(如组织病理学)可能 lacks 这些数据。本文引入 Gen-SIS,一种基于扩散模型的增强技术,仅使用无标签图像数据进行训练,消除对文本标题等外部监督来源的依赖。我们首先仅使用手工增强技术在数据集上训练初始 SSL 编码器。随后,训练一个以该 SSL 编码器嵌入为条件的扩散模型。训练后,给定源图像的嵌入,该扩散模型可合成其多样化视图。我们展示,这些“自增强”(即基于基础 SSL 编码器嵌入的生成式增强)有助于训练更强的 SSL 编码器。此外,基于在编码器潜在空间中插值 between 图像的能力,我们引入了一种新颖的预文本任务:解耦插值合成图像的两个源图像。我们通过在自然图像(通常以对象为中心)以及数字组织病理学图像(通常以语境为中心)的various downstream task 上 demonstrating performance improvements,验证了 Gen-SIS 的有效性。
引用
@article{arxiv.2412.01672,
title = {Gen-SIS: Generative Self-augmentation Improves Self-supervised Learning},
author = {Varun Belagali and Srikar Yellapragada and Alexandros Graikos and Saarthak Kapse and Zilinghan Li and Tarak Nath Nandi and Ravi K Madduri and Prateek Prasanna and Joel Saltz and Dimitris Samaras},
journal= {arXiv preprint arXiv:2412.01672},
year = {2024}
}
备注
Webpage: https://histodiffusion.github.io/docs/publications/gensis