中文

BatchSampler:为视觉、语言与图上的对比学习采样小批量

机器学习 2023-06-07 v1 计算与语言 计算机视觉与模式识别

摘要

批内对比学习是一种最先进的自监督方法,它使语义相似的实例在 mini-batch 内相互靠近,同时将不相似实例推远。其成功的关键在于负样本共享策略,其中每个实例都作为批内其他实例的负样本。近期研究旨在通过在当前 mini-batch 内采样困难负样本来提升性能,其质量受限于 mini-batch 本身。本工作中,我们提出通过从输入数据中采样 mini-batch 来改进对比学习。我们提出 BatchSampler\footnote{代码见 \url{https://github.com/THUDM/BatchSampler}} 来采样难以区分(即彼此为困难且真实的负样本)的实例组成 mini-batch。为使每个 mini-batch 含有更少的假负样本,我们设计了随机选取实例的邻近图。为构成 mini-batch,我们利用邻近图上的带重启随机游走来帮助采样难以区分的实例。BatchSampler 是一种简单通用的技术,可直接插入视觉、语言和图中的现有对比学习模型。在三种模态数据集上的大量实验表明,BatchSampler 能持续提升强大对比模型的性能,如 SimCLR 在 ImageNet-100 上、SimCSE 在 STS(语言)上、以及 GraphCL 和 MVGRL 在图数据集上的显著提升。

关键词

引用

@article{arxiv.2306.03355,
  title  = {BatchSampler: Sampling Mini-Batches for Contrastive Learning in Vision, Language, and Graphs},
  author = {Zhen Yang and Tinglin Huang and Ming Ding and Yuxiao Dong and Rex Ying and Yukuo Cen and Yangliao Geng and Jie Tang},
  journal= {arXiv preprint arXiv:2306.03355},
  year   = {2023}
}

备注

17 pages, 16 figures