COVID-19 前后欧洲团结的变化:来自一个大型众包与专家标注的 Twitter 数据集的证据
计算与语言
2021-08-03 v1 社会与信息网络
摘要
我们将社会科学中成熟的概念——社会团结及其对立面反团结——引入为自然语言处理中监督机器学习的一个新问题设置,以评估在 COVID-19 疫情被宣布为全球大流行前后,欧洲团结话语发生了怎样的变化。为此,我们利用多个人工标注者和两种标注方法(专家 vs. 众包),对 2.3 千条英文和德文推文进行了(反)团结表达的标注。我们使用这些标注来训练一个具有多种数据增强策略的 BERT 模型。我们结合了专家和众包标注的增强 BERT 模型,其性能比仅用专家标注训练的基线 BERT 分类器高出超过 25 个百分点,从 58% 的宏 F1 分数提升至近 85%。我们使用这个高质量模型自动标注了 2019 年 9 月至 2020 年 12 月间的超过 27 万条推文。然后,我们评估了自动标注的数据,以分析与欧洲团结话语相关的陈述在 COVID-19 危机之前和期间如何随时间发展并相互关联。我们的结果表明,团结在危机期间变得日益突出和受到争议。虽然团结推文的数量保持在较高水平,并在所审查的时间范围内主导了话语,但反团结推文最初激增,随后下降至接近 COVID-19 前的水平,然后上升到一个稳定的更高水平,直至 2020 年底。
引用
@article{arxiv.2108.01042,
title = {Changes in European Solidarity Before and During COVID-19: Evidence from a Large Crowd- and Expert-Annotated Twitter Dataset},
author = {Alexandra Ils and Dan Liu and Daniela Grunow and Steffen Eger},
journal= {arXiv preprint arXiv:2108.01042},
year = {2021}
}
备注
ACL 2021