中文

LLM 作为科研论文作者清单助手的实用性:NeurIPS'24 实验

计算与语言 2024-11-12 v2 数字图书馆 人机交互

摘要

大型语言模型 (LLMs) 在辅助科研同行评审方面是一种极具前景但存在争议的工具。本研究在会议环境下评估了 LLMs 作为根据投稿标准审查论文提交的工具的实用性。我们在 2024 年 Neural Information Processing Systems (NeurIPS) 会议上进行了一项实验,其中 234 篇论文被自愿提交至“基于 LLM 的清单助手”。该助手验证论文是否符合 NeurIPS 使用的作者清单,该清单包含确保遵守研究与稿件准备标准的问题。NeurIPS 论文作者对该助手的评估表明,基于 LLM 的助手在核对清单完成情况方面总体上有帮助。在使用后的调查中,超过 70% 的作者认为该助手有用,70% 的作者表示他们会根据其反馈修改论文或清单回复。虽然对该助手的因果归因尚不明确,但定性证据表明 LLM 促成了一些投稿的改进。调查回复和对重新提交稿件的分析表明,作者根据 LLM 的具体反馈对其投稿进行了实质性修改。该实验还突显了 LLM 的常见问题:不准确 (20/52) 和过于严苛 (14/52) 是作者标记最频繁的问题。我们还进行了实验以了解对系统的潜在博弈行为,结果表明可以通过捏造的理由操纵该助手以提高分数,这凸显了自动评审工具的潜在脆弱性。

关键词

引用

@article{arxiv.2411.03417,
  title  = {Usefulness of LLMs as an Author Checklist Assistant for Scientific Papers: NeurIPS'24 Experiment},
  author = {Alexander Goldberg and Ihsan Ullah and Thanh Gia Hieu Khuong and Benedictus Kent Rachmat and Zhen Xu and Isabelle Guyon and Nihar B. Shah},
  journal= {arXiv preprint arXiv:2411.03417},
  year   = {2024}
}