中文

Sina at FigNews 2024:面向偏见与宣传的多语言数据集标注

人工智能 2024-07-15 v1 计算与语言

摘要

社交媒体上偏见和宣传的现象日益严重,推动了自动检测技术的发展。本文介绍了一个包含 12,000 篇 Facebook 帖子的多语言语料库,全部标注了偏见和宣传内容。该语料库是为 FigNews 2024 共享任务中关于以色列加沙战争新闻叙事的框架任务而创建的,涵盖了自 2023 年 10 月 7 日至 2024 年 1 月 31 日期间的各种事件。该语料库包含 12,000 篇帖子,采用五种语言(阿拉伯语、希伯来语、英语、法语和印地语),每种语言各 2,400 篇。标注过程由 10 名专攻法律的研究生完成。采用插值标注一致性(IAA)评估该语料库的标注结果,偏见标注的平均 IAA 为 80.8%,宣传标注的平均 IAA 为 70.15%。我们的团队在偏见和宣传两个子任务中均名列前茅。该语料库为开源,地址为 https://sina.birzeit.edu/fada

关键词

引用

@article{arxiv.2407.09327,
  title  = {Sina at FigNews 2024: Multilingual Datasets Annotated with Bias and Propaganda},
  author = {Lina Duaibes and Areej Jaber and Mustafa Jarrar and Ahmad Qadi and Mais Qandeel},
  journal= {arXiv preprint arXiv:2407.09327},
  year   = {2024}
}