中文

基于语料库的类比与语义关系学习

机器学习 2007-05-23 v1 计算与语言 信息检索

摘要

我们提出了一种基于信息检索向量空间模型(VSM)的从无标签文本中学习的算法,能够解答类似于SAT大学入学考试中所出现的 verbal analogy 题目。 verbal analogy 的形式为A:B::C:D,意为“A对B而言,C对D亦然”;例如,mason:stone::carpenter:wood。SAT类比题目提供一个词对A:B,问题在于从五个备选答案中选择最具类比性的词对C:D。该VSM算法在374个大学水平类比题目中正确解答了47%(随机猜测正确率为20%;大学适读生平均正确率约为57%)。我们通过应用于自然语言处理中的一个难题——确定名词-修饰词对的语义关系来动机这项研究。该问题在于对诸如“激光打印机”之类的名词-修饰词对进行分类,依据名词(打印机)与修饰词(激光)之间的语义关系。我们使用监督式最近邻算法,通过在训练数据中找到最具类比性的名词-修饰词对来为给定的名词-修饰词对分配类别。在30类语义关系的情况下,针对600个标记好的名词-修饰词对集合,学习算法实现了26.5%的F值(随机猜测:3.3%)。在5类语义关系的情况下,F值为43.2%(随机:20%)。该性能在 verbal 类比和名词-修饰关系方面均为领先技术。

关键词

引用

@article{arxiv.cs/0508103,
  title  = {Corpus-based Learning of Analogies and Semantic Relations},
  author = {Peter D. Turney and Michael L. Littman},
  journal= {arXiv preprint arXiv:cs/0508103},
  year   = {2007}
}

备注

related work available at http://purl.org/peter.turney/ and http://www.cs.rutgers.edu/~mlittman/