AI 审核科学:我们能否信赖审稿人?
信息论
2026-04-28 v1 math.IT
摘要
科学稿件数量持续上升,已超过有资质的人类审稿人能力,导致编辑时间延长。与此同时,现代大型语言模型(LLM)在摘要生成、事实核查和文献筛选方面展现出惊人的能力,使得将 AI 引入同行评审变得日益诱人且不可避免。然而,早期的部署和非正式采用已暴露出严重的失效模式。近期的事件表明,隐藏在稿件中的提示注入(prompt injection)可引导 LLM 生成的评审朝着不合理的积极判断。此外,相关研究还表明,对抗性措辞会导致脆弱性,同时存在权威偏见、长度偏见以及幻觉论断。这些事件引出一个核心问题:当 AI 审核科学时,我们能否信赖 AI 审稿人?本文提供了以安全性和可靠性为中心的 AI 同行评审分析。我们在评审生命周期中绘制了攻击图谱——涵盖训练与数据检索、初筛、深度评审、复审以及系统层面。我们以四个对照实验检验 ICLR 2025 稿件的特色框架,运用两个先进的基于 LLM 的审稿人,以隔离 prestige 框架、断言强度、复审奉承以及情境投毒对评审分数的因果影响。总体而言,这套图谱和实验审计为评估和跟踪 AI 同行评审的可靠性提供了基于证据的基准,并突出了具体的失效点,以指导针对性且可测试的缓解措施。
引用
@article{arxiv.2604.23594,
title = {On the Minimum Distances of Some Families of BCH Codes},
author = {Yaqi Chen and Hao Chen and Cunsheng Ding and Huimin Lao},
journal= {arXiv preprint arXiv:2604.23594},
year = {2026}
}