MBIC——一个包含标注者特征的媒体偏见标注数据集
计算与语言
2021-05-26 v1
摘要
许多人认为新闻文章是了解时事的可靠信息来源。然而,由于影响新闻机构的因素众多,此类报道未必总是公正。媒体偏见,即倾斜的新闻报道,可能对公众的事件认知产生实质性影响,并因此有可能改变公众的信念与观点。当前媒体偏见检测研究中的主要数据缺口是一个稳健、具代表性且多样的、包含偏见词汇与句子标注的数据集。特别是,现有数据集未控制标注者的个体背景,这可能影响其评估,因而构成了将其标注语境化的关键信息。在本海报中,我们提出一种基于矩阵的方法,利用自主开发的标注平台众包此类数据。我们还提出MBIC(包含特征的媒体偏见)——首个由1700条代表各类媒体偏见实例的陈述组成的样本。这些陈述每条均由十位标注者审阅,并包含词级与句级的媒体偏见识别标签。MBIC是首个提供关于标注者特征及其个体背景详细信息的媒体偏见可用数据集。当前数据集已显著扩展了该领域的现有数据,提供了关于偏见感知的独特且更可靠的洞见。未来,我们将在文章数量与每篇文章标注者数量方面进一步扩展它。
引用
@article{arxiv.2105.11910,
title = {MBIC -- A Media Bias Annotation Dataset Including Annotator Characteristics},
author = {T. Spinde and L. Rudnitckaia and K. Sinha and F. Hamborg and B. Gipp and K. Donnay},
journal= {arXiv preprint arXiv:2105.11910},
year = {2021}
}