中文

NewB:用于政治偏见检测的 20 万余句语料库

计算与语言 2023-09-12 v2

摘要

我们提出 Newspaper Bias Dataset (NewB),一个包含来自十一家新闻源、涉及 Donald Trump 的超过 200,000 句文本的语料库。此前的语料库将句子标注为自由派或保守派,而 NewB 涵盖了十一家主流媒体源的政治观点,比传统的二分类系统捕捉到更细微的政治立场。我们训练了两个最先进的深度学习模型,以从十一家报纸中预测给定句子的新闻源,发现一个循环神经网络(recurrent neural network)的 top-1、top-3 和 top-5 准确率分别达到 33.3%、61.4% 和 77.6%,显著优于基线逻辑回归模型的 18.3%、42.6% 和 60.8% 准确率。利用句子的新闻源标签,我们用模型分析 top n-gram 以获得媒体源对 Trump 刻画方式的有意义洞察。我们希望数据集的公开发布能推动利用自然语言处理分析更复杂政治偏见的进一步研究。我们的数据集发布于 https://github.com/JerryWeiAI/NewB 。

关键词

引用

@article{arxiv.2006.03051,
  title  = {NewB: 200,000+ Sentences for Political Bias Detection},
  author = {Jerry Wei},
  journal= {arXiv preprint arXiv:2006.03051},
  year   = {2023}
}