中文

针对 LLM 生成的科学出版物审稿的提示注入攻击

机器学习 2025-09-26 v3

摘要

关于在科学同行评审过程中日益增多地使用 LLM 的持续激烈讨论,最近因有报告称作者利用隐藏的提示注入来操纵审稿评分而变得复杂。由于此类“攻击”的存在——尽管被一些评论者视为“自卫”——将对进一步的辩论产生重大影响,本文调查了所描述操纵的可行性与技术成功率。我们的系统性评估使用了由多种 LLM 生成的 2024 ICLR 论文的 1k 条审稿,结果显示出两个截然不同的结果:I) 非常简单的提示注入确实非常有效,接受率高达 100%。II) LLM 审稿普遍偏向于接受(在许多模型中 >95%)。这两个结果对当前关于在同行评审中使用 LLM 的讨论具有重大影响。

关键词

引用

@article{arxiv.2509.10248,
  title  = {Prompt Injection Attacks on LLM Generated Reviews of Scientific Publications},
  author = {Janis Keuper},
  journal= {arXiv preprint arXiv:2509.10248},
  year   = {2025}
}