跨语言新闻——跨语言文档相似度与事件跟踪
信息检索
2015-12-23 v1 计算与语言
摘要
在当今世界,我们关注全球分发的新闻。重大事件由不同来源以不同语言报道。在这项工作中,我们解决了在多语言大规模流中跟踪事件的问题。在最近开发的系统 Event Registry 中,我们考察了该问题的两个方面:如何比较不同语言的文章,以及如何链接指向同一事件的不同语言文章集合。利用多语言流和每种语言的文章簇,我们比较了基于 Wikipedia 的不同跨语言文档相似度度量。这使我们能够计算任意两篇文章的相似度,而与语言无关。在先前工作的基础上,我们展示了一些可良好扩展的方法,能够计算训练数据中直接重叠很少或没有重叠的语言之间的文章的有意义相似度。利用这一能力,我们进而提出一种跨语言链接代表同一事件的文章簇的方法。我们对系统整体进行了广泛评估,并对相似度度量与链接算法的质量和鲁棒性进行了评估。
引用
@article{arxiv.1512.07046,
title = {News Across Languages - Cross-Lingual Document Similarity and Event Tracking},
author = {Jan Rupnik and Andrej Muhic and Gregor Leban and Primoz Skraba and Blaz Fortuna and Marko Grobelnik},
journal= {arXiv preprint arXiv:1512.07046},
year = {2015}
}
备注
Accepted for publication in Journal of Artificial Intelligence Research, Special Track on Cross-language Algorithms and Applications