会飞的猪、FaR 及其后续:在反事实世界中评估 LLM 推理能力
计算与语言
2026-03-25 v2 机器学习
摘要
推理中的一个基本挑战是在假设的反事实世界中导航,在这些世界中逻辑可能与根深蒂固的知识相冲突。我们通过提出以下问题来研究大型语言模型(LLM)的这一前沿:当上下文与其参数化知识相矛盾时,LLM 能否进行逻辑推理?为了便于系统分析,我们首先引入了 CounterLogic,这是一个专门设计用于将逻辑有效性与知识对齐解耦的基准。对 11 个 LLM 在六个多样化推理数据集上的评估揭示了一致的失败:在反事实场景中,与知识对齐的场景相比,模型准确率平均骤降 14%。我们假设这一差距并非源于逻辑处理的缺陷,而是源于无法管理上下文与知识之间的认知冲突。受人类元认知启发,我们提出了一种简单而强大的干预措施:Flag & Reason(FaR),即提示模型在推理之前首先标记潜在的知识冲突。这种元认知步骤非常有效,将性能差距缩小到仅 7%,并将整体准确率提高了 4%。我们的发现诊断并研究了现代 LLM 推理中的一个关键局限性,并展示了元认知意识如何使它们成为更稳健、更可靠的思考者。
引用
@article{arxiv.2505.22318,
title = {Flying Pigs, FaR and Beyond: Evaluating LLM Reasoning in Counterfactual Worlds},
author = {Anish R Joishy and Ishwar B Balappanawar and Vamshi Krishna Bonagiri and Manas Gaur and Krishnaprasad Thirunarayan and Ponnurangam Kumaraguru},
journal= {arXiv preprint arXiv:2505.22318},
year = {2026}
}