中文

A 蕴含 B:LLMs 中用于命题逻辑推理的电路分析

机器学习 2025-06-23 v4 人工智能 计算与语言

摘要

由于现代大语言模型(LLMs)的规模和复杂性,揭示模型用于解决推理问题的底层机制已被证明具有挑战性。例如,其对特定问题的推理是否定位于网络的某些部分?它们是否将推理问题分解为模块化组件,然后在深入模型时作为连续步骤执行?为了更好地理解 LLMs 的推理能力,我们研究了一个需要结合多个事实才能得出解决方案的最小命题逻辑问题。通过在 Mistral 和 Gemma 模型(最多 27B 参数)上研究该问题,我们揭示了模型用于解决此类逻辑问题的核心组件。从机制可解释性的角度,我们使用因果中介分析来揭示 LLMs 推理过程中的路径和组件。然后,我们提供了对不同层中注意力头功能的细粒度洞察。我们不仅找到了一个计算答案的稀疏电路,还将其分解为具有四种不同和模块化用途的子电路。最后,我们揭示了三个不同的模型——Mistral-7B、Gemma-2-9B 和 Gemma-2-27B——包含类似但不完全相同的机制。

关键词

引用

@article{arxiv.2411.04105,
  title  = {A Implies B: Circuit Analysis in LLMs for Propositional Logical Reasoning},
  author = {Guan Zhe Hong and Nishanth Dikkala and Enming Luo and Cyrus Rashtchian and Xin Wang and Rina Panigrahy},
  journal= {arXiv preprint arXiv:2411.04105},
  year   = {2025}
}