中文

StepGap:一种用于多跳问答中步骤级证据缺失检测的混合 NLI-LLM 检查器

计算与语言 2026-05-26 v1

摘要

我们提出了 \textbf{StepGap},一种混合 NLI-LLM 决策树,用于检测多跳问答中的步骤级证据缺失,并输出三种类型标签:\textsc{被否认的论点} (Contradicted Claim, CC)、\textsc{无关证据} (Irrelevant Evidence, IE) 或 \textsc{缺失桥梁} (Missing Bridge, MB),每个标签都对应具体的修复动作。在82个多跳问题(181个标注步骤,κ=0.704\kappa{=}0.704)上,StepGap 达到 sF1=72.0=72.0,在置信区间内位于仅使用 LLM 的基线(70.1)之内,但其结构更具可分解性:StepGap 的每个阶段 \emph{都会} 影响 F1 分数,而四个仅使用 LLM 的移除中有三个 \emph{会提高} F1 —— 这表现出一种\emph{竞争性误差消除},即内部阶段相互掩盖彼此的错误。我们进一步暴露了一种\emph{Q-F1 陷阱}:问题级别的 F1 由于检查器对每个步骤都进行标记而被机械性地夸大,使得步骤级别的 F1 成为必要的诊断工具。作为带类型的 GRPO 过程奖励,StepGap 将 Qwen2.5-7B-Instruct 的 Exact Match 从 32.1±0.332.1{\pm}0.3 提升至 35.4±0.935.4{\pm}0.9(跨三个随机种子),其中单次运行比较显示其在匹配的 Search-R1 GRPO 复现版本上获得 +5.6+5.6 的平均 EM 增益。

关键词

引用

@article{arxiv.2605.24733,
  title  = {StepGap: A Hybrid NLI-LLM Checker for Step-Level Evidence-Gap Detectionin Multi-Hop Question Answering},
  author = {Yuelyu Ji and Zhuochun Li and Hui Ji and Daqing He},
  journal= {arXiv preprint arXiv:2605.24733},
  year   = {2026}
}