TweetsKB:一个公开的大规模标注推文 RDF 语料库
信息检索
2021-07-30 v1
摘要
公开可用的社交媒体档案促进了数据科学、社会学或数字人文等众多领域的研究,其中 Twitter 已成为最突出的来源之一。然而,获取、存档和标注大量推文成本高昂。在本文中,我们描述了 TweetsKB,一个当前包含超过 15 亿条推文、跨度近 5 年(2013年1月–2017年11月)的公开语料库。关于推文的元数据信息以及提取的实体、标签、用户提及和情感信息均使用成熟的 RDF/S 词汇表暴露。除描述提取与标注过程外,我们展示了若干用例,以说明 TweetsKB 所促进的以实体为中心的信息探索、数据集成与知识发现场景。
引用
@article{arxiv.1810.10308,
title = {TweetsKB: A Public and Large-Scale RDF Corpus of Annotated Tweets},
author = {Pavlos Fafalios and Vasileios Iosifidis and Eirini Ntoutsi and Stefan Dietze},
journal= {arXiv preprint arXiv:1810.10308},
year = {2021}
}