大语言模型能否对研究论文提供有用反馈?一项大规模实证分析
机器学习
2023-10-04 v1 人工智能
计算与语言
人机交互
摘要
专家反馈是严谨研究的基石。然而,学术产出的快速增长与知识的精细专业化对传统科学反馈机制提出挑战。高质量同行评审愈发难以获取。较为资浅或来自资源匮乏环境的研究者尤其难以获得及时反馈。随着 GPT-4 等大语言模型(LLM)的突破,利用 LLM 生成科研手稿的科学反馈日益受到关注。但 LLM 生成反馈的效用尚未被系统研究。为填补此空白,我们构建了使用 GPT-4 对科学论文完整 PDF 提供评论的自动化流水线。我们通过两项大规模研究评估 GPT-4 反馈质量。首先,我们将 GPT-4 生成反馈与 15 个 Nature 系列期刊(共 3,096 篇论文)及 ICLR 机器学习会议(1,709 篇论文)的人类同行评审反馈进行定量比较。GPT-4 与人类评审所提要点的重叠度(Nature 期刊平均 30.85%,ICLR 平均 39.23%)与两位人类评审间的重叠度(Nature 期刊平均 28.58%,ICLR 平均 35.25%)相当。对于较弱的论文,GPT-4 与人类评审的重叠度更大。随后,我们对来自美国 110 所机构的 308 名 AI 与计算生物学领域研究者开展前瞻性用户研究,以了解研究者对其自己论文上 GPT-4 系统生成反馈的感知。总体而言,超过一半(57.4%)用户认为 GPT-4 生成反馈有帮助/非常有帮助,82.4% 认为其比至少部分人类评审的反馈更有益。尽管结果表明 LLM 生成反馈可帮助研究者,我们也识别出若干局限。
引用
@article{arxiv.2310.01783,
title = {Can large language models provide useful feedback on research papers? A large-scale empirical analysis},
author = {Weixin Liang and Yuhui Zhang and Hancheng Cao and Binglu Wang and Daisy Ding and Xinyu Yang and Kailas Vodrahalli and Siyu He and Daniel Smith and Yian Yin and Daniel McFarland and James Zou},
journal= {arXiv preprint arXiv:2310.01783},
year = {2023}
}