中文

大语言模型是否对娱乐新闻更加怀疑?

人工智能 2026-05-05 v1 计算机与社会

摘要

大型语言模型(LLM)日益用于自动新闻可信度评估,但是否存在跨新闻类型均衡应用的疑问仍不明确。我们检验了零样本 LLM 是否更倾向于将合法娱乐新闻误分类为假新闻,而将合法硬性新闻正确分类。本文基于 GossipCop 数据集(来自 FakeNewsNet)进行了数据内设计实验。我们发现,四个前沿模型均呈现明显但模型特定的体裁不对称:DeepSeek-V3.2 和 GPT-5.2 分别显示出 10.1 和 8.8 个百分点的误报率差(两个 p < .001),而 Claude Opus 4.6 和 Gemini 3 Flash 则未显示出类似差异。风格置换实验仅产生有限且不一致的更改,表明这种不对称并非仅由风格注册因素所致。基于提示的缓解措施同样可行但并非通用:将模型设定为娱乐新闻事实核查员,可将 DeepSeek-V3.2 的误报率降低约 50%,而对 GPT-5.2 的改善有限。探索性定性编码进一步表明,抽样的误报中存在两种常见错误模式:将私人生活声明视为本质不可核查的,以及将娱乐新闻视为认识上较弱的体裁。综上所述,这些发现表明,聚合性能指标可能掩盖合法新闻体裁内的结构化误报。我们认为,基于 LLM 的可信度评估不仅评估真实性主张,还可能对新闻体裁的合法性进行差异化识别,因而评估应包括体裁分层的误报分析,而不仅仅是整体准确率。

关键词

引用

@article{arxiv.2605.01727,
  title  = {Are LLMs More Skeptical of Entertainment News?},
  author = {Huiqian Lai},
  journal= {arXiv preprint arXiv:2605.01727},
  year   = {2026}
}

备注

Accepted at the 2nd Workshop on Misinformation Detection in the Era of LLMs (MisD), co-located with ICWSM 2026, May 26, 2026, Los Angeles, CA, USA