中文

评估商业AI聊天机器人作为新闻中介者的表现

计算与语言 2026-05-22 v1

摘要

AI聊天机器人正快速塑造人们接触新闻的方式,但目前尚无研究系统测量了这些系统(其专有搜索集成和检索-合成管道)在跨语言和跨地区处理新事实的准确性。我们对2026年2月9-22日这段14天期间,对六个AI聊天机器人(Gemini 3 Flash和Pro、Grok 4、Claude 4.5 Sonnet、GPT-5和GPT-4o mini)进行评估,问题来源于来自六个区域服务(美国与加拿大、阿拉伯语、阿布赫兹、印地语、俄语、土耳其语)的BBC News当日报道,共计2100个事实问题。最佳系统在关于数小时前报道事件的问题上实现超过90%的多选题准确率。然而,相同系统在自由回答评估下准确率下降11-13%,在整体评估中下降16-17%。我们进一步刻画了三种失败模式。首先,所有模型在印地语(79%)的最低准确率,而其他语言均在89-91%之间,引用显示了英语检索偏见(例如,模型回答印地语查询时引用的English Wikipedia比任何印地语媒体都多)。其次,检索错误而非推理错误是70%以上错误的主要来源。当模型检索到正确来源时,往往能提取出正确答案;问题在于首先不能落在正确的来源上。第三,模型在结构良好问题上达到88-96%的准确率,但在包含微妙错误前提的问题上准确率下降至19-70%,最易受影响的模型在64%的情况下接受虚构事实。我们还识别出一种检测-准确率悖论:性能最好的虚假前提检测器在对抗性准确率上排名第二(放弃率最高),而性能较弱的检测器排名第一,表明前提检测和答案恢复是部分独立的能力。总体而言,这些发现表明,高准确率可能掩盖了系统性的区域不平等、对检索基础设施的绝对依赖,以及对现实用户提出的查询不完美的脆弱性。

关键词

引用

@article{arxiv.2605.22785,
  title  = {Evaluating Commercial AI Chatbots as News Intermediaries},
  author = {Mirac Suzgun and Emily Shen and Federico Bianchi and Alexander Spangher and Thomas Icard and Daniel E. Ho and Dan Jurafsky and James Zou},
  journal= {arXiv preprint arXiv:2605.22785},
  year   = {2026}
}

备注

https://suzgunmirac.github.io/ai-news-preview/