TweetsCOV19——关于 COVID-19 大流行的语义标注推文知识库
社会与信息网络
2020-08-18 v4 信息检索
摘要
公开可用的社交媒体档案促进了社会科学的研究,并为训练和测试广泛的机器学习与自然语言处理方法提供了语料库。关于 2019 年冠状病毒病(COVID-19)近期暴发,Twitter 上的在线话语反映了公众对该大流行本身以及缓解措施及其社会影响的意见和认知。理解此类话语、其演变以及与现实世界事件或(错误)信息的相互依存关系可以催生有价值的见解。另一方面,此类语料库是解决情感分析、事件检测或实体识别等任务的计算方法的关键促进因素。然而,获取、存档和语义标注大量推文成本高昂。在本文中,我们描述了 TweetsCOV19,一个公开可用的知识库,目前包含超过 800 万条推文,时间跨度为 2019 年 10 月至 2020 年 4 月。关于推文的元数据以及提取的实体、标签、用户提及、情感和网络链接使用既有的 RDF/S 词汇表暴露出来,为一系列知识发现任务提供了前所未有的知识库。除描述该数据集及其抽取与标注过程外,我们给出了该语料库的初步分析与用例。
引用
@article{arxiv.2006.14492,
title = {TweetsCOV19 -- A Knowledge Base of Semantically Annotated Tweets about the COVID-19 Pandemic},
author = {Dimitar Dimitrov and Erdal Baran and Pavlos Fafalios and Ran Yu and Xiaofei Zhu and Matthäus Zloch and Stefan Dietze},
journal= {arXiv preprint arXiv:2006.14492},
year = {2020}
}