中文

利用大小写增强正例与检索负例改进句子嵌入的对比学习

计算与语言 2022-06-07 v1 信息检索

摘要

继 SimCSE 之后,基于对比学习的方法在学习句子嵌入方面取得了最先进(SOTA)性能。然而,无监督对比学习方法仍远落后于有监督对应方法。我们将此归因于正样本与负样本的质量,并旨在同时改进二者。具体而言,对于正样本,我们提出切换大小写增强,将句中随机选词的首字母大小写翻转。这是为了抵消预训练词元嵌入对词频、单词大小写与子词的内在偏置。对于负样本,我们基于预训练语言模型从整个数据集中采样困难负例。将上述两种方法结合 SimCSE,我们提出的用于句子嵌入的增强与检索数据对比学习(CARDS)方法在无监督设定下的 STS 基准上显著超越当前 SOTA。

关键词

引用

@article{arxiv.2206.02457,
  title  = {Improving Contrastive Learning of Sentence Embeddings with Case-Augmented Positives and Retrieved Negatives},
  author = {Wei Wang and Liangzhu Ge and Jingqiao Zhang and Cheng Yang},
  journal= {arXiv preprint arXiv:2206.02457},
  year   = {2022}
}

备注

7 pages, 3 figures, 6 tables. Accepted to SIGIR 22. Code at https://github.com/alibaba/SimCSE-with-CARDS