中文

Pcc调优:打破语义文本相似度中的对比学习瓶颈

计算与语言 2024-10-08 v2

摘要

语义文本相似度(STS)是计算语言学中的关键研究方向,也是嵌入模型编码能力的重要指标。得益于预训练语言模型和对比学习的进步,领先的句子表示方法在SentEval中的七个STS基准测试上平均达到约86的斯佩尔曼相关系数分数。然而,进一步的进展变得日益有限,现有方法在这些任务上无一能突破86.5的平均分数。本文对此现象进行深入分析,得出结论:在对比学习下,斯佩尔曼相关系数分数的上限为87.5。为突破这一瓶颈,我们提出一种创新方法,称为Pcc调优,该方法采用皮尔逊相关系数作为损失函数,以超越对比学习的性能限制。实验结果表明,Pcc调优仅需少量精细标注样本,即可显著优于先前的SOTA策略。

关键词

引用

@article{arxiv.2406.09790,
  title  = {Pcc-tuning: Breaking the Contrastive Learning Ceiling in Semantic Textual Similarity},
  author = {Bowen Zhang and Chunping Li},
  journal= {arXiv preprint arXiv:2406.09790},
  year   = {2024}
}

备注

Accepted by EMNLP 2024 (Main)