中文

FLAWS:面向科学论文错误识别与定位的基准

计算与语言 2025-12-01 v1 人工智能 数字图书馆 机器学习

摘要

错误的识别与定位是同行评审中的核心任务,但随着科学产出的指数级增长,人类评审者因专家资源有限, increasingly难以可靠地检测错误。近期大型语言模型(LLM)的进展引发了人们对其在学术同行评审、自动化科学评估等评估任务中发挥作用的潜力的关注。然而,尽管LLM在评审系统中的应用日益增长,其定位错误的能力仍未得到充分探索。本文引入Fault Localization Across Writing in Science(FLAWS),一个由713个论文-错误对组成的自动化基准,用于评估大型语言模型检测危及研究论文关键论点错误的效果。我们通过系统性地在同行审稿论文中插入使论点失效的错误,构建了该基准,同时配合一种自动化评估指标,衡量模型是否能够识别并定位这些错误。构建此类基准具有独特挑战:确保插入的错误定义明确、具有挑战性且与论文内容相关,避免会使识别变得 trivial 的人为痕迹,以及设计一种可扩展的自动化评估指标。在所得基准上,我们评估了五种前沿大型语言模型:Claude Sonnet 4.5、DeepSeek Reasoner v3.1、Gemini 2.5 Pro、GPT 5和Grok 4。在这些模型中,GPT 5表现最佳, achieving 39.1%的识别准确率(k=10时),其中k为大型语言模型生成的前k名错误文本候选数。

关键词

引用

@article{arxiv.2511.21843,
  title  = {FLAWS: A Benchmark for Error Identification and Localization in Scientific Papers},
  author = {Sarina Xi and Vishisht Rao and Justin Payan and Nihar B. Shah},
  journal= {arXiv preprint arXiv:2511.21843},
  year   = {2025}
}

备注

30 pages, 12 tables, 2 figures