BadScientist:研究代理人能否撰写令人信服但不健全的论文来蒙蔽 LLM 评审?
密码学与安全
2025-10-22 v1 人工智能
计算机与社会
摘要
LLM powered research assistants 与 AI 驱动的同行评价系统的融合创造了一个关键漏洞:在没有人工监督的情况下,AI 生成的研究被 AI 评审者评估的完全自动出版循环。我们通过 BadScientist 框架评估了 fabrication-oriented paper generation agents 是否能欺骗多模型 LLM 评审系统。我们的生成器采用无需真实实验的 presentation-manipulation 策略。我们开发了一个严格的评估框架,具有形式化错误保证(浓度界限和校准分析),在真实数据上校准。我们的结果揭示了系统性漏洞:制造的论文达到最高可达的接受率。关键的是,我们识别出 concern-acceptance conflict —— 评审者经常会指出完整性问题,但会分配接受水平的分数。我们的缓解策略仅显示出仅略微的改进,检测准确率 barely 超过随机机会。尽管具有 provable sound aggregation 数学,完整性检查系统性地失败,暴露了当前 AI 驱动评价系统的根本局限性,强调在科学出版中迫切需要防御性加固。
引用
@article{arxiv.2510.18003,
title = {BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?},
author = {Fengqing Jiang and Yichen Feng and Yuetai Li and Luyao Niu and Basel Alomair and Radha Poovendran},
journal= {arXiv preprint arXiv:2510.18003},
year = {2025}
}