中文

媒体偏见探测器:面向新闻大规模标注与分析的框架

计算与语言 2025-10-01 v1

摘要

主流新闻机构不仅通过发布的文章直接塑造公众认知,还通过选择覆盖哪些主题(或忽略哪些主题)以及如何呈现所决定覆盖的问题来间接塑造认知。然而,在规模化层面衡量这些微妙形式的媒体偏见仍是一个挑战。本文介绍了一个大型持续开发(自2024年1月1日至今)、接近实时的数据集和计算框架,以支持系统性研究新闻报道中的选择偏见和框架偏见。我们的管道将大型语言模型(LLM)与可扩展的接近实时新闻抓取相结合,从而提取结构化标注,包括政治倾向、语调、主题、文章类型和重大事件,覆盖数百篇文章每日。我们在多个层面上量化这些覆盖维度——句子层面、文章层面和出版方层面,拓展了研究人员分析现代新闻领域中媒体偏见的方式。除了精选数据集外,我们还发布了一个用于便捷数据探索的交互式网页平台。总体而言,这些贡献为规模化媒体偏见研究提供了可复用的方法,为未来研究提供了实证资源。利用语料库随时间和出版方的广度,我们还展示了一些案例(聚焦2024年审阅的15万多篇文章),说明这一新型数据集如何揭示新闻报道和偏见的有见解模式,支持学术研究和现实中改进媒体问责的努力。

关键词

引用

@article{arxiv.2509.25649,
  title  = {The Media Bias Detector: A Framework for Annotating and Analyzing the News at Scale},
  author = {Samar Haider and Amir Tohidi and Jenny S. Wang and Timothy Dörr and David M. Rothschild and Chris Callison-Burch and Duncan J. Watts},
  journal= {arXiv preprint arXiv:2509.25649},
  year   = {2025}
}