揭示大型语言模型在学术同行评审中的风险
计算与语言
2024-12-03 v1 人工智能
人机交互
机器学习
摘要
学术同行评审是科学进步的基石,但由于稿件提交量不断增加和过程耗时,系统正受到压力。近期大型语言模型 (LLM) 的进展导致其被集成到同行评审中,展现出与人类生成评审高度重合的潜在效应。然而,未受控制的 LLM 采用可能严重威胁同行评审系统的完整性。本研究聚焦 LLM 生成评审的漏洞,分析操纵性及内在缺陷。我们的实验表明,通过向手稿中注入隐蔽的刻意内容可被操纵 LLM 评审,从而导致评分虚高并与人类评审不一致。我们的模拟显示,若操纵 5% 的评审,可能导致 12% 的论文失去排名前 30% 的位置。此外,隐式操纵(作者有策略地突出手稿中的微小局限性)进一步表明 LLM 相对于人类评审更易受操纵,其与披露局限性的一致性高出 4.5 倍。此外,LLM 还表现出内在缺陷,如对不完整论文给予更高评分而低估完整论文,以及在单盲评审中偏好知名作者。这些发现凸显了过度依赖 LLM 进行同行评审的风险,强调我们尚未准备好广泛采用,强调需要 robust 的监控措施。
引用
@article{arxiv.2412.01708,
title = {Are We There Yet? Revealing the Risks of Utilizing Large Language Models in Scholarly Peer Review},
author = {Rui Ye and Xianghe Pang and Jingyi Chai and Jiaao Chen and Zhenfei Yin and Zhen Xiang and Xiaowen Dong and Jing Shao and Siheng Chen},
journal= {arXiv preprint arXiv:2412.01708},
year = {2024}
}
备注
27 pages, 24 figures