选举煽动数据集:以波兰选举为用例
计算与语言
2023-07-17 v1
摘要
社交媒体的流行使政治家将其用于政治广告。因此,社交媒体上充斥着选举煽动(electioneering),尤其在竞选活动期间。选举管理机构无法追踪根据选举法构成煽动的消息的传播与数量。这解决了一个关键问题,同时也揭示了一个迄今未被有效针对的空白。因此,我们提出了首个公开开放的用于波兰语选举煽动检测的数据集。它包含 6,112 条人工标注的推文,标有四个法定条件类别。我们达到了 0.66 的标注者间一致性(Cohen's kappa 分数)。一名额外标注者解决了前两位之间的差异,提升了标注过程的一致性与复杂性。新创建的数据集被用于微调一个名为 HerBERT 的波兰语语言模型(达到 68% 的 F1 分数)。我们还展示了此类数据集与模型的若干潜在用例,并通过对 Twitter 上波兰 2020 年总统选举的分析丰富了本文。
引用
@article{arxiv.2307.07007,
title = {Electoral Agitation Data Set: The Use Case of the Polish Election},
author = {Mateusz Baran and Mateusz Wójcik and Piotr Kolebski and Michał Bernaczyk and Krzysztof Rajda and Łukasz Augustyniak and Tomasz Kajdanowicz},
journal= {arXiv preprint arXiv:2307.07007},
year = {2023}
}
备注
5 pages, 3 figures, Language Resources and Evaluation Conference