SciTweets——用于检测科学在线话语的数据集与标注框架
计算与语言
2022-07-07 v2 计算机与社会
社会与信息网络
摘要
科学主题、主张与资源正日益作为在线话语的一部分被讨论,其中突出的例子包括与 COVID-19 或气候变化相关的话语。这既带来了重大的社会影响,也引起了各学科对科学在线话语的日益关注。例如,传播学研究旨在深入理解科学信息的偏差、质量或传播模式,而计算方法则被提出用于利用 NLP 和 IR 技术提取、分类或验证科学主张。然而,跨学科研究目前既缺乏对各种科学相关性形式的稳健定义,也缺乏用于区分它们的适当真值数据。在这项工作中,我们贡献了:(a) 一个标注框架及相应定义,用于推文中在线话语的不同科学相关性形式;(b) 通过我们的标注框架获得的 1261 条专家标注推文数据集,达到平均 Fleiss Kappa 为 0.63;(c) 在我们数据上训练的多标签分类器,能够以 89% F1 检测科学相关性,并能够检测不同形式的科学知识(主张、参考文献)。通过这项工作,我们旨在为开发和评估用于分析大规模在线话语中科学的稳健方法奠定基础。
引用
@article{arxiv.2206.07360,
title = {SciTweets -- A Dataset and Annotation Framework for Detecting Scientific Online Discourse},
author = {Salim Hafid and Sebastian Schellhammer and Sandra Bringay and Konstantin Todorov and Stefan Dietze},
journal= {arXiv preprint arXiv:2206.07360},
year = {2022}
}
备注
submitted to CIKM 2022