基于维基百科的自然语言处理语义解释
计算与语言
2014-01-23 v1
摘要
充分表示自然语言语义需要获取大量的常识和特定领域的世界知识。该领域的先前工作或基于不使用背景知识的纯统计技术,或基于 WordNet 等有限的词汇知识库,或基于 CYC 项目等巨大的人工工程。本文提出一种新颖的方法,称为显式语义分析(Explicit Semantic Analysis,ESA),用于对无限制自然语言文本进行细粒度语义解释。我们的方法在源自现存最大百科全书——维基百科的高维概念空间中表示意义。我们以基于维基百科的概念显式表示任何文本的意义。我们在文本分类和计算自然语言文本片段间的语义相关度两个任务上评估了该方法的有效性。使用 ESA 在这两项任务上均取得了相较此前最优水平的显著提升。重要的是,由于使用了自然概念,ESA 模型易于向人类用户解释。
引用
@article{arxiv.1401.5697,
title = {Wikipedia-based Semantic Interpretation for Natural Language Processing},
author = {Evgeniy Gabrilovich and Shaul Markovitch},
journal= {arXiv preprint arXiv:1401.5697},
year = {2014}
}