LLM是否偏好LLM?量化同行评审中的相互作用效应
人工智能
2026-01-30 v1 计算机与社会
摘要
有越来越多的迹象表明,LLM不仅用于生产科学论文,还被用于同行评审流程中。本文提供了对LLM在同行评审整个管道中使用的首次全面分析,尤其关注相互作用效应:不仅关注LLM辅助论文或LLM辅助评审在孤立情况下的差异,更关注LLM辅助评审是否对LLM辅助论文进行不同评估。特别是,我们分析了来自ICLR、NeurIPS和ICML的超过125,000篇论文-评审配对。我们最初观察到一种似乎系统性的相互作用效应:LLM辅助评审似乎对LLM辅助论文特别友好。然而,控制论文质量后发现差异不同的故事:LLM辅助评审只是对一般情况下质量较低的论文更宽容,LLM辅助论文在较弱提交中过度代表导致了虚假的相互作用效应,而非对LLM生成内容的真实偏好。通过增强我们的观察性发现与完全由LLM生成的评审,我们发现完全由LLM生成的评审表现出严重的评级压缩,难以区分论文质量,而人类评审使用LLM则显著减少了这种宽容度。最后,检查 metareviews,我们发现LLM辅助 metareviews 更可能接受决定,而与人类 metareviews在等效评审分数下相同,但完全由LLM生成的 metareviews tends to be harsher。这表明 meta-reviewers 并不仅仅是将决策外包给LLM。这些发现为制定治理LLM在同行评审中使用的政策提供了重要输入,更普遍地表明了LLM如何与现有决策流程相互作用。
引用
@article{arxiv.2601.20920,
title = {Do LLMs Favor LLMs? Quantifying Interaction Effects in Peer Review},
author = {Vibhhu Sharma and Thorsten Joachims and Sarah Dean},
journal= {arXiv preprint arXiv:2601.20920},
year = {2026}
}
备注
28 pages