中文

《媒体偏见注释数据集 MediaSpin:后出版新闻标题编辑》

计算与语言 2026-05-18 v5

摘要

我们提出 MediaSpin 数据集,这是一个大规模语言资源,捕捉主要新闻机构在出版后修改标题的方式,以及 MediaSpin-in-the-Wild 这一互补数据集,将这些修订后的标题与其在社交媒体上的后续参与度相关联。不断变化的在线新闻标题提供了通过编辑修订来研究语言框架和偏见的新机会。该数据集包含 78,910 组标题对,标注了 13 种媒体偏见类型,基于既定的媒体偏见分类体系,涵盖主观性(如制造感古论、倾向性)和客观性(如遗漏、倾向性)形式,标注通过人类监督的大语言模型管道完成,包含专家验证和质量控制。我们描述了标注方案,并演示了三种下游应用:(1)跨国分析标题编辑中国家引用的添加或删除情况;(2)基于 Transformer 的偏见分类,涵盖二分类和细粒度水平;(3)使用 180,786 条来自 819 名同意用户的 X(Twitter)相关新闻推文,对偏见标题的行为进行分析。结果显示,地区在表征性框架方面存在不对称性,存在可衡量的语言标记,且偏见内容的参与度始终高于非偏见内容。MediaSpin 和 MediaSpin-in-the-Wild 共同为偏见检测以及当代媒体生态系统中的编辑与行为动态提供了可复现的基准。

关键词

引用

@article{arxiv.2412.02271,
  title  = {The MediaSpin Dataset: Post-Publication News Headline Edits Annotated for Media Bias},
  author = {Preetika Verma and Kokil Jaidka},
  journal= {arXiv preprint arXiv:2412.02271},
  year   = {2026}
}

备注

8 pages, 3 figures, 8 tables Accepted at AAAI ICWSM 2026 We updated the paper title from "MediaSpin: Exploring Media Bias Through Fine-Grained Analysis of News Headlines " to "The MediaSpin Dataset: Post-Publication News Headline Edits Annotated for Media Bias"