利用情感计算词语相似度
信息检索
2012-09-19 v2 计算与语言
摘要
本文提出了一种新的基于 WordNet 的相似度度量方法 SenSim,该方法通过纳入被比较词语的情感内容(即正面或负面情感的程度)来衡量它们之间的相似度。所提出的度量方法基于这样一个假设:了解情感信息有助于衡量相似度。为了验证这一假设,我们测量并比较了两种标注策略下的标注者一致性:1) 标注时考虑一对词语的情感信息;2) 标注时不考虑一对词语的情感信息。标注者间相关性得分表明,当两位标注者在为一对词语分配相似度得分时考虑情感信息,其一致性更好。我们利用这一假设来衡量一对词语之间的相似度。具体而言,我们将每个词语表示为一个向量,该向量包含该词语义项在 WordNet 释义中所有内容词语的情感得分。这些情感得分源自情感词典。随后,我们测量这两个向量之间的余弦相似度。我们对 SenSim 进行了内在和外在评估,并将其性能与其他广泛使用的 WordNet 相似度度量方法进行了比较。
引用
@article{arxiv.1209.2341,
title = {Leveraging Sentiment to Compute Word Similarity},
author = {A. R. Balamurali and Subhabrata Mukherjee and Akshat Malu and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:1209.2341},
year = {2012}
}
备注
The paper is available at http://subhabrata-mukherjee.webs.com/publications.htm