利用社交媒体中的微集合生成网络存档采集的种子
摘要
在一个充斥着消失资源的网络中,网络存档采集为保存对研究从选举到疾病爆发等过去事件至关重要的网络资源提供了一种宝贵手段。这些存档采集始于由策展人手工挑选的种子 URI(统一资源标识符)。策展人通过移除不相关的 URI 并添加来自可信和权威来源的 URI 来生成高质量种子,但收集这些种子十分耗时。策展人用于发现种子的两种主要策略包括抓取网络(如 Google)搜索引擎结果页(SERP)和社交媒体(如 Twitter)SERP。在这项工作中,我们研究了三个社交媒体平台,以揭示来自不同来源的种子特征。首先,我们开发了一个简单的词汇表,用于描述跨不同平台的社交媒体帖子。其次,我们引入了一种新颖的来源,用于从单个或多个用户创建的社交媒体帖子线程对话中的 URI 生成种子。社交媒体网站上的用户 routinely 创建并分享关于新闻事件的帖子,其中包含手工挑选的新闻报道、推文、视频等 URI。在这项工作中,我们称这些帖子为微集合(micro-collections),并将其视为种子的重要来源,因为创建微集合所付出的努力表明了编辑活动和领域专业知识的体现。第三,我们通过来自 Reddit、Twitter 和 Scoop.it 的 449,347 条社交媒体帖子,使用文本和标签查询生成了 23,112 个种子采集。我们总共从常规抓取的 SERP 帖子和微集合中收集了 120,444 个 URI。我们从多个维度刻画了所得种子采集的特征,包括 URI 分布、精确度、时效、网页多样性等。
引用
@article{arxiv.1905.12220,
title = {Using Micro-collections in Social Media to Generate Seeds for Web Archive Collections},
author = {Alexander C. Nwala and Michele C. Weigle and Michael L. Nelson},
journal= {arXiv preprint arXiv:1905.12220},
year = {2019}
}
备注
This is an extended version of the ACM/IEEE Joint Conference on Digital Libraries (JCDL 2019) full paper. Some figures have been enlarged, and appendices of additional figures included