Archive-It 的多种形态
数字图书馆
2021-01-26 v1
摘要
网络档案作为数字保存的关键领域,满足了记者、社会科学家、历史学家和政府组织的需求。这些群体的用例通常要求他们自己引导归档过程,选择自己的原始资源(即种子)并创建自己的网络档案集合。我们关注 Archive-It 中的集合,这是互联网档案馆于 2005 年推出的一项订阅服务,旨在让组织创建自己的归档网页或 memento 集合。理解这些集合可以通过用户提供的元数据或文本分析来实现,但元数据在不同集合之间应用不一致,且某些 Archive-It 集合包含数十万个种子,使得下载每个 memento 在时间上代价高昂。我们的工作提出使用结构元数据作为理解这些集合的附加方式。我们探索这些集合中当前存在的能够揭示策展与抓取行为的结构特征。我们改编了集合增长曲线的概念,用于理解 Archive-It 集合的策展与抓取行为。我们还引入了若干种子特征,并理解了构成集合的资源的多样性。最后,我们利用每个集合的描述识别出 Archive-It 集合的四种语义类别。使用所识别的结构特征,我们审查了 20 个分类器运行的结果,并能够使用 Random Forest 分类器以 0.720 的加权平均 F1 分数预测集合的语义类别,从而将结构层面与描述层面相桥接。我们的方法很有用,因为它节省了研究人员的时间和带宽。通过语义类别识别集合可让进一步的下游处理针对这些类别进行定制。
引用
@article{arxiv.1806.06878,
title = {The Many Shapes of Archive-It},
author = {Shawn M. Jones and Alexander Nwala and Michele C. Weigle and Michael L. Nelson},
journal= {arXiv preprint arXiv:1806.06878},
year = {2021}
}
备注
10 pages, 12 figures, to appear in the proceedings of the 15th International Conference on Digital Preservation (iPres 2018)