中文

C2-Faith:面向链式思维推理中因果性与覆盖性忠实度的 LLM 评估基准

泛函分析 2026-03-06 v1

摘要

大语言模型(LLM)越来越多地被用作链式思维(CoT)推理的裁判,但它们是否能够可靠地评估过程忠实性(而不仅仅是答案的合理性)仍不明确。我们引入 C2-Faith,一个基于 PRM800K 构建的基准,聚焦于两个互补的忠实性维度:因果性(每一步是否逻辑地从 prior context 演绎?)和覆盖性(是否存在关键中间推断?)。通过受控扰动,我们创建具有已知因果错误位置的示例(通过替换单个步骤为非因果变体),并在不同的删除率下进行覆盖性删除(针对参考标签评分)。我们评估了三种前沿裁判在三个任务下的表现:二元因果检测、因果步骤定位和覆盖性评分。结果显示,模型排名在任务框架下高度依赖,且不存在单一裁判在所有情境下均占优;所有裁判在检测错误与定位错误之间存在显著差距;且覆盖性判断在不完整推理时被系统性高估。这些发现阐明了 LLM 裁判何时可靠,何时会失败,并为在过程级评估中选择裁判提供实用指导。

关键词

引用

@article{arxiv.2603.05166,
  title  = {Complete Nevanlinna-Pick property of $\mathbb K$-Invariant Reproducing Kernels},
  author = {Miroslav Engliš and Somnath Hazra and Paramita Pramanick},
  journal= {arXiv preprint arXiv:2603.05166},
  year   = {2026}
}

备注

27 pages