中文

词嵌入在复杂句子语义相似度评估中的比较分析

计算与语言 2021-07-13 v3 信息检索

摘要

语义文本相似度是自然语言处理领域的开放研究挑战之一。该领域已开展广泛研究,近期基于transformer的模型在现有基准数据集(如STS数据集与SICK数据集)上取得了近乎完美的结果。本文中,我们研究这些数据集中的句子,并分析各类词嵌入对句子复杂度的敏感性。我们构建了一个复杂句子数据集,包含50个句子对,其语义相似度值由15名人类标注者给出。我们进行了可读性分析,以凸显现有基准数据集与所提数据集中句子复杂度的增加。此外,我们对各类词嵌入与语言模型在现有基准数据集与所提数据集上的表现进行了比较分析。结果表明,句子复杂度的增加对嵌入模型表现有显著影响,导致Pearson与Spearman相关度下降10–20%。

关键词

引用

@article{arxiv.2010.12637,
  title  = {Comparative analysis of word embeddings in assessing semantic similarity of complex sentences},
  author = {Dhivya Chandrasekaran and Vijay Mago},
  journal= {arXiv preprint arXiv:2010.12637},
  year   = {2021}
}

备注

14 pages, 6 figures, submitted to IEEE Access