中文

支持大规模网络档案高效标注的语义URL分析

信息检索 2017-02-03 v1

摘要

长期网络档案包含较长时间段收集的网页文档,其规模很容易达到数百太字节。诸如命名实体之类的语义标注可促进对网络档案数据的智能访问。然而,在此规模上标注整个档案内容通常不可行。访问网络档案内文档的最有效方式是通过其 URL 提供,这些 URL 通常存储在专用索引文件中。归档网页文档的 URL 可包含语义信息,并为归档文档提供获取初始语义标注的高效途径。在本文中,我们分析了语义分析技术(如命名实体抽取)对网络档案中 URL 的适用性。我们在 Popular German Web 数据集上评估了从 URL 抽取命名实体的精度,并分析了 2000 年至 2012 年时间区间内来自 1,444 个流行域的归档 URL 中这些技术适用的比例。我们的结果表明,命名实体识别可成功应用于我们网络档案中的大量 URL,并为高效标注大规模网页文档集合提供了良好的起点。

关键词

引用

@article{arxiv.1702.00619,
  title  = {Semantic URL Analytics to Support Efficient Annotation of Large Scale Web Archives},
  author = {Tarcisio Souza and Elena Demidova and Thomas Risse and Helge Holzmann and Gerhard Gossen and Julian Szymanski},
  journal= {arXiv preprint arXiv:1702.00619},
  year   = {2017}
}