记忆片段及其内容的获取规则
数字图书馆
2016-02-24 v2
摘要
网页文本提取有许多应用,包括网络爬虫优化和文档聚类。尽管关于活网页内容获取已有大量论述,但被称为记忆片段(mementos)的归档网页的内容获取仍相对新颖。在进行一项近70万网页的研究过程中,我们遇到了获取记忆片段并从中提取文本的问题。通过HTTP获取记忆片段内容原本预期是相对轻松的工作,但我们发现了相反的情况。我们还发现,已知存在问题的HTML解析,当试图跨许多网页归档提取记忆片段的文本时,由于涉及不同的记忆片段呈现行为以及其记忆片段中HTML的年代,可能变得更加复杂。为了惠及跨许多网页归档获取记忆片段的其他人,我们在此记录这些经验。
引用
@article{arxiv.1602.06223,
title = {Rules of Acquisition for Mementos and Their Content},
author = {Shawn M. Jones and Harihar Shankar},
journal= {arXiv preprint arXiv:1602.06223},
year = {2016}
}
备注
16 pages, 6 figures, 13 listings