你的论文会被 LLM 审核吗?对等值审稿中 AI 文本检测的基准测试
计算与语言
2026-02-09 v3 人工智能
摘要
同行评审是确保已发布科学研究完整性的关键过程。对这一过程的信任依赖于相关领域的专家对提交给出版物的手稿予以认真考虑的假设。随着大语言模型(LLM)近期快速进步,同行评审过程面临新的风险:即疏忽的评审者会依赖 LLM 来执行耗时的评审论文的过程。然而,现有资源不足以对 AI 文本在等值审稿领域的可检测性进行基准测试。为填补这一不足,我们引入了一个综合数据集,包含总计 788,984 篇由 AI 编写的等值审稿,配有对应的人类审稿,覆盖每所两所领先的人工智能研究会议(ICLR 和 NeurIPS)提交的 8 年论文。我们使用这一新资源评估 18 种现有的 AI 文本检测算法,区分等值审稿是完全由人类撰写还是由不同的最先进 LLM 撰写。此外,我们探索一种称为 Anchor 的上下文感知检测方法,该方法利用手稿内容来检测 AI 生成的审稿,并分析检测模型对 LLM 辅助人类文本编辑的灵敏度。我们的工作揭示了在单个等值审稿水平上识别 AI 生成文本的困难,凸显了检测这一道德违规行为的生成式 AI 的紧迫需求。我们的数据集已公开于:https://huggingface.co/datasets/IntelLabs/AI-Peer-Review-Detection-Benchmark。
引用
@article{arxiv.2502.19614,
title = {Is Your Paper Being Reviewed by an LLM? Benchmarking AI Text Detection in Peer Review},
author = {Sungduk Yu and Man Luo and Avinash Madasu and Vasudev Lal and Phillip Howard},
journal= {arXiv preprint arXiv:2502.19614},
year = {2026}
}
备注
Accepted to ICLR 2026