中文

ReviewerGPT?关于使用大语言模型进行论文评审的探索性研究

计算与语言 2023-06-02 v1 人工智能 数字图书馆

摘要

鉴于大语言模型(LLMs)的快速崛起,我们研究如下问题:(如何)大语言模型能够如何帮助评审科学论文或基金提案?我们首先进行了一些试点研究,发现(i)GPT-4 优于其他 LLM(Bard、Vicuna、Koala、Alpaca、LLaMa、Dolly、OpenAssistant、StableLM),且(ii)针对特定问题(例如识别错误)的提示优于直接提示撰写评审。基于这些见解,我们研究了 LLM(具体为 GPT-4)在三项任务中的使用:1. 识别错误:我们构建了 13 篇简短的计算机科学论文,每篇故意插入一个错误,并要求 LLM 检查这些论文的正确性。我们观察到 LLM 在其中 7 篇中发现了错误,涵盖数学与概念性错误。2. 验证检查清单:我们让 LLM 在 15 篇 NeurIPS 2022 论文的相应章节中验证 16 个封闭式检查清单问题。我们发现,在 119 个 {检查清单问题, 论文} 对中,LLM 的准确率为 86.6%。3. 选择“更优”论文:我们生成了 10 对摘要,刻意设计每对使得其中一篇明显优于另一篇。然而,LLM 难以准确辨别这些相对直白的区别,在 10 对中有 6 对做出了错误评估。基于这些实验,我们认为 LLM 作为针对特定评审任务的评审助手具有前景,但(尚)不能用于论文或提案的完整评估。

关键词

引用

@article{arxiv.2306.00622,
  title  = {ReviewerGPT? An Exploratory Study on Using Large Language Models for Paper Reviewing},
  author = {Ryan Liu and Nihar B. Shah},
  journal= {arXiv preprint arXiv:2306.00622},
  year   = {2023}
}