中文

用于无监督句嵌入的平滑对比学习

计算与语言 2022-09-13 v2 人工智能

摘要

对比学习已逐渐被应用于学习高质量的无监督句嵌入。在以往的无监督方法中,据我们所知,最新的SOTA方法是 unsupervised SimCSE (unsup-SimCSE)。unsup-SimCSE 在训练阶段使用 InfoNCE 损失函数,通过将语义相似的句子拉近并将不相似的句子推远。从理论上讲,我们期望在 unsup-SimCSE 中使用更大的批次以获得样本间更充分的比较并避免过拟合。然而,增加批次大小并不总能带来改进,相反,当批次大小超过某一阈值时甚至会导致性能下降。通过统计观察,我们发现这可能是由于增加批次大小后引入了低置信度负对。为了缓解这一问题,我们在 InfoNCE 损失函数上引入了一种简单的平滑策略,称为 Gaussian Smoothing InfoNCE (GS-InfoNCE)。具体而言,我们添加随机高斯噪声向量作为负样本,起到对负样本空间进行平滑的作用。尽管简单,所提出的平滑策略为 unsup-SimCSE 带来了实质性的改进。我们在标准语义文本相似度(STS)任务上评估了 GS-InfoNCE。基于 BERT-base、BERT-large、RoBERTa-base 和 RoBERTa-large,GS-InfoNCE 的 Spearman 相关系数平均分别超出 SOTA unsup-SimCSE 1.38%、0.72%、1.17% 和 0.28%。

关键词

引用

@article{arxiv.2109.04321,
  title  = {Smoothed Contrastive Learning for Unsupervised Sentence Embedding},
  author = {Xing Wu and Chaochen Gao and Yipeng Su and Jizhong Han and Zhongyuan Wang and Songlin Hu},
  journal= {arXiv preprint arXiv:2109.04321},
  year   = {2022}
}

备注

COLING 2022