中文

用于组合性检测的排序列表距离与相关性度量研究

计算与语言 2017-03-13 v1

摘要

语言中的组合性是指某个短语的意义在多大程度上可以分解为其组成部分的意义以及这些组成部分的组合方式。基于同义词替换保持意义这一前提,组合性可以近似为短语与其单词被同义词替换后的版本之间的语义相似度。表示此类短语的方式有多种(例如向量[1]或语言模型[2]),而表示方式的选择会影响语义相似度的测量。我们提出一种新的组合性检测方法,将短语表示为词项权重的排序列表。我们的方法使用一系列已知的距离和相关性度量来近似两个排序列表表示之间的语义相似度。与组合性检测领域的大多数最先进方法相比,我们的方法是完全无监督的。在一个包含1048个人工标注短语的公开数据集上的实验表明,与强监督基线相比,我们的方法在使用所考虑的任何一种距离和相关性度量时,都能提供更优的组合性测量。

关键词

引用

@article{arxiv.1703.03640,
  title  = {A Study of Metrics of Distance and Correlation Between Ranked Lists for Compositionality Detection},
  author = {Christina Lioma and Niels Dalum Hansen},
  journal= {arXiv preprint arXiv:1703.03640},
  year   = {2017}
}