DeltaLogic:最小前提编辑揭示逻辑推理模型中的信念修正失败
人工智能
2026-04-06 v1
摘要
推理基准通常评估模型是否能从固定前提集推导出正确答案,但它们低估了一种在动态环境中同样重要的相关能力:在最小证据变化下的信念修正。我们引入了DeltaLogic,一种基准转换协议,将自然语言推理示例转化为简短的修正片段。每个片段首先在前提P下询问初始结论,然后应用最小编辑δ(P),最后询问之前的结论是否应保持稳定或被修正。我们从FOLIO和ProofWriter实例化DeltaLogic,并使用约束标签评分评估小型因果语言模型。在完成的30片段Qwen评估子集上,更强的初始推理并不意味着更强的修正行为:Qwen3-1.7B达到0.667的初始准确率,但修正准确率仅为0.467,在金标应改变的片段上惯性上升至0.600,而Qwen3-0.6B则陷入近乎普遍的拒绝回答。在那里,Qwen3-4B保持了相同的惯性失败模式(初始0.650,修正后0.450,惯性0.600),而Phi-4-mini-instruct则明显更强(初始0.950,修正后0.850),但仍表现出不可忽略的拒绝回答和控制不稳定性。这些结果表明,在固定前提下的逻辑能力并不意味着在局部证据编辑后进行有纪律的信念修正。因此,DeltaLogic针对一种独特的且实际重要的推理能力,补充了现有的逻辑推理和信念更新基准。
引用
@article{arxiv.2604.02733,
title = {DeltaLogic: Minimal Premise Edits Reveal Belief-Revision Failures in Logical Reasoning Models},
author = {Amit Dhanda},
journal= {arXiv preprint arXiv:2604.02733},
year = {2026}
}
备注
ICLR 2026 Workshop on Logical Reasoning of Large Language Models