中文

计算词汇对比度

计算与语言 2013-08-30 v1

摘要

了解词语之间语义对比的程度在自然语言处理中有广泛的应用,包括机器翻译、信息检索和对话系统。人工创建的词典关注反义词,例如 {\rm hot} 和 {\rm cold}。反义词有多种类型,如对立反义词、互补反义词和等级反义词。然而,现有的词典通常不将反义词分类为不同的类型。它们也没有明确列出那些不是反义词但在意义上具有一定对比度的词对,例如 {\rm warm} 和 {\rm cold} 或 {\rm tropical} 和 {\rm freezing}。我们提出了一种自动识别对比词对的方法,该方法基于以下假设:如果一对词 AABB 是对比的,那么存在一对反义词 CCDD,使得 AACC 强相关,BBDD 强相关。(例如,存在反义词对 {\rm hot} 和 {\rm cold},使得 {\rm tropical} 与 {\rm hot} 相关,{\rm freezing} 与 {\rm cold} 相关。)我们将此称为对比假设。我们首先进行一项大型众包实验,以确定人类在反义性概念及其不同类型上的一致程度。在此过程中,我们充实了不同类型反义词的关键特征。然后,我们提出了一种基于对比假设、语料库统计和类 {\it Roget} 同义词词典结构的词汇对比度的自动和经验测量方法。我们表明,所提出的词汇对比度测量方法获得了高精度和大覆盖率,优于现有方法。

关键词

引用

@article{arxiv.1308.6300,
  title  = {Computing Lexical Contrast},
  author = {Saif M. Mohammad and Bonnie J. Dorr and Graeme Hirst and Peter D. Turney},
  journal= {arXiv preprint arXiv:1308.6300},
  year   = {2013}
}