中文

解耦 LLM 中的知识与推理:基于认知双系统理论的探索

计算机视觉与模式识别 2026-04-06 v2 人工智能

摘要

虽然大语言模型(LLMs)在推理过程中利用知识和推理,但区分两者的能力在模型分析、可解释性和开发中发挥着关键作用。 Inspired by dual-system cognitive theory,我们提出了一种认知归因框架,用于解耦知识和推理的贡献。具体而言,将 LLM 的认知分解为两个 distinct 且互补的阶段:知识检索(第 1 阶段)和推理调整(第 2 阶段)。为分离这两个阶段,我们要求 LLMs 在两种认知模式下生成答案,分别是快速思维和慢速思维。分析不同认知模式下的性能,以量化知识和推理的贡献。我们将该架构应用于 15 个 LLMs 和 3 个数据集。结果显示:(1)推理调整是 domain-specific 的,受益于推理密集型领域(如数学、物理和化学),并可能损害知识密集型领域。(2)参数规模提升了知识和推理,知识提升更为显著。此外,参数规模使 LLMs 的推理更为谨慎,同时稍微更聪明。(3)知识主要位于 lower 网络层,而推理则在 higher 层中运行。我们的框架不仅有助于从“解耦”视角理解 LLMs,也为现有研究提供了新见解,包括 scaling laws、分层知识编辑和小模型推理的局限性。

关键词

引用

@article{arxiv.2507.18177,
  title  = {Differential-UMamba: Rethinking Tumor Segmentation Under Limited Data Scenarios},
  author = {Dhruv Jain and Romain Modzelewski and Romain Herault and Clement Chatelain and Eva Torfeh and Sebastien Thureau},
  journal= {arXiv preprint arXiv:2507.18177},
  year   = {2026}
}