中文

ReFACT:带有位置误差标注的科学虚构检测基准

计算与语言 2026-04-24 v3

摘要

大型语言模型(LLMs)中科学虚构的潜在机制仍不清楚。我们引入了 ReFACT(Reddit False And Correct Texts),这是一个包含 1,001 对专家标注的问答对基准,其具有源自 Reddit 的 r/AskScience 的跨度级误差标注。对 9 个最先进的 LLMs 的评估揭示了两个关键局限性。首先,模型表现出一种占主导地位的“显著干扰物”失败模式:61% 的错误跨度预测在语义上与实际错误无关。关键在于,这种模式在所有模型规模(1B 到 70B)中持续存在,表明存在一种仅靠扩展规模无法解决的根本性语义基础缺失。其次,我们发现比较判断反而比独立检测更难,即使在并排比较答案时,GPT-4o 的 F1 分数也从 0.67 降至 0.53。这些发现直接挑战了 LLM-as-Judge 范式在科学事实性方面的可靠性。代码和数据发布于 https://github.com/ddz5431/ReFACT。

关键词

引用

@article{arxiv.2509.25868,
  title  = {ReFACT: A Benchmark for Scientific Confabulation Detection with Positional Error Annotations},
  author = {Yindong Wang and Martin Preiß and Margarita Bugueño and Jan Vincent Hoffbauer and Abdullatif Ghajar and Tolga Buz and Gerard de Melo},
  journal= {arXiv preprint arXiv:2509.25868},
  year   = {2026}
}

备注

Accepted to EACL 2026 (Main Conference, Oral presentation)