维基百科树化与分层显式语义分析
计算与语言
2012-02-03 v2
摘要
[这是提交至 TALN 2012 的论文"Arborification de Wikipédia et analyse sémantique explicite stratifiée"的译文。] 我们提出了 Gabrilovich 和 Markovitch 的显式语义分析(Explicit Semantic Analysis)方法的扩展。利用他们的语义相关性度量,我们对维基百科类别图进行加权。随后,使用 Chu-Liu & Edmonds 算法提取最小生成树。我们定义了一种分层 tfidf 概念,其中对于给定的维基百科页面和给定术语,其层级包括经典 tfidf 以及该术语在页面祖先类别(就最小生成树意义上的祖先而言)中的类别 tfidf。我们的方法基于这种分层 tfidf,它为在类别树中向上攀爬时得以“保留”的术语增加了额外权重。我们在 WikiNews 语料库上通过文本分类评估了我们的方法:其精度提高了 18%。最后,我们为未来研究提供了一些线索。
引用
@article{arxiv.1201.6224,
title = {Wikipedia Arborification and Stratified Explicit Semantic Analysis},
author = {Yannis Haralambous and Vitaly Klyuev},
journal= {arXiv preprint arXiv:1201.6224},
year = {2012}
}
备注
13 pages, 2 figures, submitted to conference TALN 2012