基于词义词典的文本关联度计算
计算与语言
2014-01-23 v1
摘要
自动计算两段文本之间的关联度,需要综合考虑这两段文本所传达意义的多种因素,以及它们词语之间的成对关系。毫无疑问,文本片段间的关联度度量必须兼顾词语间的词汇关联度和语义关联度。一种能够同时良好捕捉文本关联度这两个方面的度量,可有助于许多任务,如文本检索、分类和聚类。本文提出了一种基于词语间隐式语义链接来度量词语间语义关联度的新方法。该方法仅利用一部词义词典来构建词语间的隐式语义链接。基于此方法,我们引入了 Omiotis,这是一种新的文本间语义关联度度量,它利用词到词的语义关联度度量(SR)并将其扩展到度量文本间的关联度。我们逐步验证了我们的方法:首先评估了单个词语间语义关联度度量的性能,涵盖词到词的相似度与关联度、同义词识别和词语类比;然后,我们继续在两个任务中评估我们方法在度量文本到文本语义关联度方面的性能,即句到句相似度和释义识别。实验评估表明,在所选择的任务和使用的数据集上,所提出的方法优于所有基于词典的语义关联度方法,并能与基于语料库的方法和混合方法很好地竞争。
引用
@article{arxiv.1401.5699,
title = {Text Relatedness Based on a Word Thesaurus},
author = {George Tsatsaronis and Iraklis Varlamis and Michalis Vazirgiannis},
journal= {arXiv preprint arXiv:1401.5699},
year = {2014}
}