面向语言模型多步推理能力的一种机制可解释性研究
计算与语言
2023-10-24 v1
摘要
近期研究表明,语言模型(LMs)具有强大的多步(即过程性)推理能力。然而,尚不清楚 LMs 是通过记忆预训练语料中的答案来“作弊”完成这些任务,还是通过多步推理机制来完成。本文试图通过探索 LMs 在多步推理任务上的机制可解释性来回答这一问题。具体而言,我们假设 LM 在其内部隐式嵌入了一棵类似于正确推理过程的推理树。我们通过引入一种新的探测方法(称为 MechanisticProbe)来检验该假设,该方法从模型的注意力模式中恢复推理树。我们使用该探针分析了两个 LMs:在合成任务(第 k 小元素)上的 GPT-2,以及在两个简单的基于语言的推理任务(ProofWriter 与 AI2 Reasoning Challenge)上的 LLaMA。我们表明,MechanisticProbe 能够从大多数例子的模型注意力中检测出推理树的信息,这表明在许多情况下 LM 确实在其架构内经历了一个多步推理过程。
引用
@article{arxiv.2310.14491,
title = {Towards a Mechanistic Interpretation of Multi-Step Reasoning Capabilities of Language Models},
author = {Yifan Hou and Jiaoda Li and Yu Fei and Alessandro Stolfo and Wangchunshu Zhou and Guangtao Zeng and Antoine Bosselut and Mrinmaya Sachan},
journal= {arXiv preprint arXiv:2310.14491},
year = {2023}
}
备注
This work is published in EMNLP 2023