SNCSE:基于软负样本的无监督句子嵌入对比学习
计算与语言
2022-03-03 v3
摘要
无监督句子嵌入旨在为句子获得最恰当的嵌入以反映其语义。对比学习正吸引日益增长关注。对于句子,当前模型利用多样的数据增强方法生成正样本,而将其他独立句子视为负样本。随后它们采用 InfoNCE 损失拉近正样本对嵌入、推远负样本对嵌入。尽管这些模型在句子嵌入上取得很大进展,我们认为它们可能遭受特征抑制。模型未能区分并解耦文本相似度与语义相似度,且可能高估任何具有相似文本的句子对之间的语义相似度,而不顾其间的实际语义差异。这是因为无监督对比学习中的正样本对通过数据增强带有相似甚至相同文本。为缓解特征抑制,我们提出基于软负样本的无监督句子嵌入对比学习(SNCSE)。软负样本与原始样本共享高度相似文本但具有确定且明显不同的语义。具体而言,我们取原始句子的否定作为软负样本,并提出双向边界损失(BML)将其引入仅涉及正、负样本的传统对比学习框架。实验结果表明,SNCSE 在语义文本相似度(STS)任务上取得最先进性能,在 BERTbase 和 RoBERTabase 上平均 Spearman 相关系数分别为 78.97% 和 79.23%。此外,我们采用基于排序的误差分析方法检测 SNCSE 的不足以供未来研究。
引用
@article{arxiv.2201.05979,
title = {SNCSE: Contrastive Learning for Unsupervised Sentence Embedding with Soft Negative Samples},
author = {Hao Wang and Yangguang Li and Zhen Huang and Yong Dou and Lingpeng Kong and Jing Shao},
journal= {arXiv preprint arXiv:2201.05979},
year = {2022}
}
备注
7 pages, 4 figures