是否要信任:面向AI辅助评审的作者回应
计算机与社会
2026-05-19 v1 人工智能
摘要
大型语言模型日益被讨论并用作协助学术同行评审的工具,但关于作者如何使用和感知AI反馈的实证证据仍有限。本文报告了来自两个计算机科学 venue 的两项独立试点研究 findings,关于作者如何使用和感知AI辅助评审。在评审发布后,邀请作者完成关于AI评审有用性、可信度、与人类评审的一致性、对修订的实际价值、感知到的不准确之处以及同意意见的匿名后评审问卷。最终数据集包括56个可分析的回应,来自40篇论文的作者;对封闭式题目使用描述性统计概括,对开放式回应采用归纳主题分析。大多数受访者 (83.9%) 认为AI评审有用,80.4% 的作者报告称其识别出人类评审未提及的问题。这种感知的额外价值转化为行动:82.1% 的作者报告称在摄影-ready版本中至少部分采用了AI反馈。然而,作者并不将AI评审视为等同于人类评审。他们普遍信任度较低,认为人类反馈更清晰,尽管25.0% 的受访者描述至少一些人类评审并不实用。对AI评审的报告问题通常有限:51.8% 的受访者报告轻微不准确,16.1% 的受访者报告明显不正确、误导或无关的评论。对未来使用的支持最强烈的条件是将AI框架为受监督或由作者控制的工具:96.4% 的受访者表示他们会将AI用作提交前的内部评审工具,89.3% 的受访者倾向于提前通知AI将用于评审,76.8% 的受访者支持在使用前获得明确同意。
引用
@article{arxiv.2605.16623,
title = {To Trust or Not to Trust: Authors' Response to AI-based Reviews},
author = {César Leblanc and Lukas Picek},
journal= {arXiv preprint arXiv:2605.16623},
year = {2026}
}