中文

句子编码器的棘手困境:标准基准上的成功与基本语义属性捕捉上的失败

计算与语言 2023-09-08 v1

摘要

在本文中,我们采用回顾性方法来考察和比较五种现有流行的句子编码器,即 Sentence-BERT、Universal Sentence Encoder (USE)、LASER、InferSent 和 Doc2vec,在下游任务性能与捕捉基本语义属性能力方面的表现。最初,我们在流行的 SentEval 基准上评估了所有五个句子编码器,发现多个句子编码器在多种流行下游任务上表现相当好。然而,由于无法在所有情况下找出单一优胜者,我们设计了进一步的实验以更深入理解其行为。具体而言,我们提出了四项语义评估准则,即释义、同义词替换、反义词替换和句子打乱,并使用这些准则评估了相同的五个句子编码器。我们发现 Sentence-Bert 和 USE 模型通过了释义准则,其中 SBERT 在两者间更优。LASER 在同义词替换准则下占优。有趣的是,所有句子编码器均未通过反义词替换和打乱准则。这些结果表明,尽管这些流行句子编码器在 SentEval 基准上表现相当好,它们仍难以捕捉某些基本语义属性,从而给 NLP 研究带来了棘手的困境。

关键词

引用

@article{arxiv.2309.03747,
  title  = {The Daunting Dilemma with Sentence Encoders: Success on Standard Benchmarks, Failure in Capturing Basic Semantic Properties},
  author = {Yash Mahajan and Naman Bansal and Shubhra Kanti Karmaker},
  journal= {arXiv preprint arXiv:2309.03747},
  year   = {2023}
}