中文

语言模型中的推理电路:三段论推理的机械性解释

计算与语言 2025-06-24 v3 人工智能 机器学习

摘要

关于语言模型推理的近期研究引发了关于它们能否学习系统性推理原则还是仅利用训练数据中的表面模式的争论。为理解和揭示语言模型中形式推理所采用的机制,本文对三段论推理进行了机械性解释。具体而言,我们提出了一种面向电路发现的方法论,旨在解释内容无关和形式推理机制。通过两种不同的干预方法,我们揭示了一个涉及中项抑制的充分必要电路,阐明了语言模型如何传递信息以从前提推导出有效结论。此外,我们研究信念偏差如何在三段论推理中表现,发现了来自编码常识和语境化知识的额外注意力头的部分污染证据。最后,我们探索了所发现机制在各种三段论方案、模型规模和架构之间的泛化性。所识别的电路对于模型达到高准确率(>60%)的三段论方案是充分必要的,且在不同模型族之间具有兼容的激活模式。整体而言,我们的发现表明语言模型学习了可迁移的内容无关推理机制,但同时这些机制不涉及可泛化和抽象的逻辑原语,容易受到预训练期间获得的相同世界知识的污染。

关键词

引用

@article{arxiv.2408.08590,
  title  = {Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inference},
  author = {Geonhee Kim and Marco Valentino and André Freitas},
  journal= {arXiv preprint arXiv:2408.08590},
  year   = {2025}
}

备注

Accepted to Findings of ACL 2025