DiffAug:以无领域知识的基于扩散的数据增强强化无监督对比学习
机器学习
2024-05-28 v2 计算工程、金融与科学
计算机视觉与模式识别
摘要
无监督对比学习在视觉、生物学等领域日益重要,其利用预定义的阳性/阴性样本进行表示学习。数据增强分为手工设计与基于模型的方法,已被认为是提升对比学习的关键组件。然而,手工设计方法需要领域特定数据方面的人类专业知识,且有时会扭曲数据含义。相比之下,基于生成模型的方法通常需要有监督或大规模外部数据,这已成为制约许多领域模型训练的瓶颈。为解决上述问题,本文提出 DiffAug,一种基于扩散模型生成阳性数据的新型无监督对比学习技术。DiffAug 由语义编码器与条件扩散模型组成;条件扩散模型以语义编码为条件生成新的阳性样本,服务于无监督对比学习的训练。借助语义编码器与扩散模型的迭代训练,DiffAug 以不间断且无监督的方式提升表示能力。实验评估表明,DiffAug 在 DNA 序列、视觉与生物特征数据集上优于手工设计与 SOTA 基于模型的增强方法。供审阅的代码发布于 \url{https://github.com/zangzelin/code_diffaug}。
引用
@article{arxiv.2309.07909,
title = {DiffAug: Enhance Unsupervised Contrastive Learning with Domain-Knowledge-Free Diffusion-based Data Augmentation},
author = {Zelin Zang and Hao Luo and Kai Wang and Panpan Zhang and Fan Wang and Stan. Z Li and Yang You},
journal= {arXiv preprint arXiv:2309.07909},
year = {2024}
}
备注
accepted by ICML24