面向神经算法推理的机制可解释性:MINAR
机器学习
2026-02-26 v1 人工智能
摘要
近期的神经算法推理 (NAR) 领域研究图神经网络 (GNN) 能够模拟诸如 Bellman-Ford 等经典算法的能力,这被称为算法对齐现象。与此同时,近期在大语言模型 (LLM) 方面的进展催生了机制可解释性研究,这旨在识别执行特定计算的细粒度模型组件,如执行特定计算的电路。在本工作中,我们引入面向神经算法推理的机制可解释性 (MINAR),这是一种高效电路发现工具箱,它将机制可解释性中的归因补丁方法适用于 GNN 环境。我们通过两个案例研究表明,MINAR 从 GNN 在算法任务上训练得到的模型中恢复出忠实的神经水平电路。我们的研究为电路形成与训练期间的修剪过程提供了新的视角,同时洞察了在多个任务中并行训练的 GNN 如何复用与相关任务相关的电路组件。我们的代码已在 https://github.com/pnnl/MINAR 上提供。
引用
@article{arxiv.2602.21442,
title = {MINAR: Mechanistic Interpretability for Neural Algorithmic Reasoning},
author = {Jesse He and Helen Jenne and Max Vargas and Davis Brown and Gal Mishne and Yusu Wang and Henry Kvinge},
journal= {arXiv preprint arXiv:2602.21442},
year = {2026}
}