中文

解释新闻偏见检测:Transformer 模型决策机制的比较 SHAP 分析

计算与语言 2026-01-01 v1 人工智能 人机交互

摘要

新闻文本中的自动化偏见检测被广泛用于支持新闻分析和媒体问责,但人们对偏见检测模型如何做出决策或为何失败知之甚少。在本工作中,我们对两个基于 Transformer 的偏见检测模型进行了比较可解释性研究:一个是在 BABE 数据集上微调的偏见检测器,另一个是在 BABE 数据集上微调的领域自适应预训练 RoBERTa 模型,均使用基于 SHAP 的解释。我们分析了正确和错误预测中的词级归因,以表征不同模型架构如何将语言偏见操作化。我们的结果表明,尽管两个模型都关注相似类别的评价性语言,但它们在如何将这些信号整合到预测中存在显著差异。偏见检测器模型对假阳性分配的内部证据强度高于真阳性,表明归因强度与预测正确性之间存在错位,导致对中性新闻内容的系统性过度标记。相比之下,领域自适应模型表现出与预测结果更好对齐的归因模式,并减少了 63\% 的假阳性。我们进一步证明,模型错误源于不同的语言机制,假阳性是由话语层面的歧义而非显式偏见线索驱动的。这些发现突出了可解释性感知评估对偏见检测系统的重要性,并表明架构和训练选择严重影响新闻语境下的模型可靠性和部署适用性。

关键词

引用

@article{arxiv.2512.23835,
  title  = {Explaining News Bias Detection: A Comparative SHAP Analysis of Transformer Model Decision Mechanisms},
  author = {Himel Ghosh},
  journal= {arXiv preprint arXiv:2512.23835},
  year   = {2026}
}

备注

10 pages, 8 figures