LLM 作为科研论文作者清单助手的实用性:NeurIPS'24 实验
计算与语言
2024-11-12 v2 数字图书馆
人机交互
摘要
大型语言模型 (LLMs) 在辅助科研同行评审方面是一种极具前景但存在争议的工具。本研究在会议环境下评估了 LLMs 作为根据投稿标准审查论文提交的工具的实用性。我们在 2024 年 Neural Information Processing Systems (NeurIPS) 会议上进行了一项实验,其中 234 篇论文被自愿提交至“基于 LLM 的清单助手”。该助手验证论文是否符合 NeurIPS 使用的作者清单,该清单包含确保遵守研究与稿件准备标准的问题。NeurIPS 论文作者对该助手的评估表明,基于 LLM 的助手在核对清单完成情况方面总体上有帮助。在使用后的调查中,超过 70% 的作者认为该助手有用,70% 的作者表示他们会根据其反馈修改论文或清单回复。虽然对该助手的因果归因尚不明确,但定性证据表明 LLM 促成了一些投稿的改进。调查回复和对重新提交稿件的分析表明,作者根据 LLM 的具体反馈对其投稿进行了实质性修改。该实验还突显了 LLM 的常见问题:不准确 (20/52) 和过于严苛 (14/52) 是作者标记最频繁的问题。我们还进行了实验以了解对系统的潜在博弈行为,结果表明可以通过捏造的理由操纵该助手以提高分数,这凸显了自动评审工具的潜在脆弱性。
引用
@article{arxiv.2411.03417,
title = {Usefulness of LLMs as an Author Checklist Assistant for Scientific Papers: NeurIPS'24 Experiment},
author = {Alexander Goldberg and Ihsan Ullah and Thanh Gia Hieu Khuong and Benedictus Kent Rachmat and Zhen Xu and Isabelle Guyon and Nihar B. Shah},
journal= {arXiv preprint arXiv:2411.03417},
year = {2024}
}