中文

新闻标题中极端党派性的计算评估

计算与语言 2024-04-23 v2

摘要

我们首先采用人机协同的机器学习框架,以主动学习方式开发了一个用于极端党派性新闻标题检测的新数据集,包含 2,200 条人工标注和 180 万条机器标注的标题,这些标题由九个代表性媒体机构(分属左翼、中间和右翼三个媒体偏见组)自 2014 年至今发布。一个微调的基于 transformer 的语言模型在外部验证集上取得了 0.84 的总体准确率和 0.78 的 F1 分数。接下来,我们进行计算分析以量化新闻标题中党派性的程度与动态。尽管某些方面符合预期,我们的研究揭示了三个媒体组之间新的或细微的差异。我们发现总体而言右翼媒体倾向于使用比例上更多的极端党派性标题。大约在 2016 年总统大选前后,所有媒体偏见组的极端党派性标题比例均有所上升,其中左翼媒体表现出最显著的相对增长。我们利用逻辑回归模型和 Shapley 值识别出包括外交问题、政治制度和社会问题在内的三个主要话题,它们暗示了新闻标题中的极端党派性。通过话题分布分析,我们发现社会问题逐渐获得所有媒体组更多的关注。我们进一步将基于词典的语言分析工具应用于每个话题的标题,并量化三个媒体组任意两两之间的语言距离,揭示了三种不同的模式。

关键词

引用

@article{arxiv.2301.06270,
  title  = {Computational Assessment of Hyperpartisanship in News Titles},
  author = {Hanjia Lyu and Jinsheng Pan and Zichen Wang and Jiebo Luo},
  journal= {arXiv preprint arXiv:2301.06270},
  year   = {2024}
}

备注

Accepted for publication in ICWSM 2024