超越事实准确性:使用 LogicScore 评估 RAG 系统的全局推理完整性
计算与语言
2026-05-11 v4
摘要
当前检索增强生成(RAG)的评估方法存在“事实近视”问题:它们一味强调事实准确性,却忽视了长文本答案生成中的全局逻辑完整性。这驱使模型强行建立不自然的联系,产生虽然基于事实但在逻辑上不连贯的回答,存在未解决的空白、含糊的关联或冗余的前提。为了缓解这一问题,我们提出了 LogicScore,将评估从局部的、逐事实的评估转向严格的全局推理审查。基于 Horn Rules,我们的方法集成了反向验证机制,以系统地评估三个关键推理维度:完整性(逻辑严密的推演)、必要性(非冗余性)和确定性(一致的答案蕴含)。在三个多跳问答数据集(HotpotQA、MusiQue 和 2WikiMultiHopQA)以及超过 20 个 LLMs(包括 GPT-5、Gemini-3-Pro、LLaMA3 和任务特定微调模型)上的大量实验揭示了一个关键的能力差距:领先的模型通常能实现高事实准确性(例如 Gemini-3 Pro 的精确率为 92.85%),但在全局推理质量方面表现不佳(例如 Gemini-3 Pro 的必要性得分仅为 35.11%)。我们的工作确立了逻辑评估的稳健标准,强调了在 LLM 开发中需将推理连贯性与事实基础并重。
引用
@article{arxiv.2601.15050,
title = {Beyond Factual Accuracy: Evaluating Global Reasoning Integrity in RAG Systems with LogicScore},
author = {Zhichao Yan and Yunxiao Zhao and Jiapu Wang and Jiaoyan Chen and Xiaoli Li and Ru Li and Jeff Z. Pan},
journal= {arXiv preprint arXiv:2601.15050},
year = {2026}
}