中文

CLAIMCHECK:大语言模型对科学论文批评的 grounding 程度如何?

计算与语言 2025-03-28 v1

摘要

科学同行评审的核心环节之一是提供对论文所作主张的专业性批评。虽然现在可以自动生成看似合理(但通用)的评论,但确保这些评论在论文主张上是 sound 且 grounded 的仍然具有挑战性。为促进大语言模型在这些挑战方面的基准测试,我们引入 CLAIMCHECK,这是一个来自 NeurIPS 2023 和 2024 提交论文及其评论的 annotated 数据集,数据来源于 OpenReview。CLAIMCHECK 由 ML 专家丰富地标注了评论中的 weakness 语句以及它们 dispute 的论文主张,以及所识别 weakness 的有效性、客观性和类型的细粒度标签。我们在 CLAIMCHECK 支持的三个以 claim 为中心的任务上对多种大语言模型进行基准测试,要求模型(1)将 weakness 与其 dispute 的 claim 关联起来,(2)预测 weakness 的细粒度标签并重写 weakness 以提高其具体性,(3)以 grounded reasoning 验证论文的主张。我们的实验显示,虽然前沿大语言模型在(2)中具有预测 weakness 标签的能力,但在除其他所有任务外均表现不佳,与人类专家相比表现不足。

关键词

引用

@article{arxiv.2503.21717,
  title  = {CLAIMCHECK: How Grounded are LLM Critiques of Scientific Papers?},
  author = {Jiefu Ou and William Gantt Walden and Kate Sanders and Zhengping Jiang and Kaiser Sun and Jeffrey Cheng and William Jurayj and Miriam Wanner and Shaobo Liang and Candice Morgan and Seunghoon Han and Weiqi Wang and Chandler May and Hannah Recknor and Daniel Khashabi and Benjamin Van Durme},
  journal= {arXiv preprint arXiv:2503.21717},
  year   = {2025}
}