BatchSampler:为视觉、语言与图上的对比学习采样小批量
机器学习
2023-06-07 v1 计算与语言
计算机视觉与模式识别
摘要
批内对比学习是一种最先进的自监督方法,它使语义相似的实例在 mini-batch 内相互靠近,同时将不相似实例推远。其成功的关键在于负样本共享策略,其中每个实例都作为批内其他实例的负样本。近期研究旨在通过在当前 mini-batch 内采样困难负样本来提升性能,其质量受限于 mini-batch 本身。本工作中,我们提出通过从输入数据中采样 mini-batch 来改进对比学习。我们提出 BatchSampler\footnote{代码见 \url{https://github.com/THUDM/BatchSampler}} 来采样难以区分(即彼此为困难且真实的负样本)的实例组成 mini-batch。为使每个 mini-batch 含有更少的假负样本,我们设计了随机选取实例的邻近图。为构成 mini-batch,我们利用邻近图上的带重启随机游走来帮助采样难以区分的实例。BatchSampler 是一种简单通用的技术,可直接插入视觉、语言和图中的现有对比学习模型。在三种模态数据集上的大量实验表明,BatchSampler 能持续提升强大对比模型的性能,如 SimCLR 在 ImageNet-100 上、SimCSE 在 STS(语言)上、以及 GraphCL 和 MVGRL 在图数据集上的显著提升。
引用
@article{arxiv.2306.03355,
title = {BatchSampler: Sampling Mini-Batches for Contrastive Learning in Vision, Language, and Graphs},
author = {Zhen Yang and Tinglin Huang and Ming Ding and Yuxiao Dong and Rex Ying and Yukuo Cen and Yangliao Geng and Jie Tang},
journal= {arXiv preprint arXiv:2306.03355},
year = {2023}
}
备注
17 pages, 16 figures