博客圈上的命名实体演化识别
计算与语言
2017-02-07 v1 数字图书馆
摘要
技术和文化的进步导致我们语言的变化。这些变化在用户已知的语言与存储在数字档案中的语言之间造成了鸿沟。它影响了用户首先查找内容以及其次解释该内容的可能性。在之前的工作中,我们介绍了用于报纸合集的命名实体演化识别(Named Entity Evolution Recognition, NEER)方法。最近,Web 保存方面日益增多的努力使得涵盖更长时间跨度的 Web 档案可用性增加。然而,Web 上的语言比传统媒体更具动态性,并且来自报纸领域的许多基本假设并不适用于 Web 数据。在本文中,我们讨论了现有 NEER 方法的局限性。我们通过调整现有的 NEER 方法以处理诸如 Web 尤其是博客圈(Blogosphere)之类的噪声数据来解决这些局限性。我们开发了新颖的过滤器来降低噪声,并利用语义网(Semantic Web)资源获取关于术语的更多信息。我们的评估显示了所提方法的潜力。
引用
@article{arxiv.1702.01187,
title = {Named Entity Evolution Recognition on the Blogosphere},
author = {Helge Holzmann and Nina Tahmasebi and Thomas Risse},
journal= {arXiv preprint arXiv:1702.01187},
year = {2017}
}
备注
IJDL 2015