权重稀疏 Transformer 具有可解释回路
机器学习
2025-11-18 v1 人工智能
摘要
在语言模型中发现人类可理解的回路是机制可解释性领域的核心目标。我们通过将模型的大部分权重约束为零,使得每个神经元仅具有少量连接,从而训练出具有更易理解回路的模型。为了恢复多个手工设计任务背后的细粒度回路,我们对模型进行剪枝,以隔离出负责该任务的部分。这些回路通常包含与自然概念相对应的神经元和残差通道,它们之间具有少量可直接解释的连接。我们研究了这些模型的扩展规律,发现使权重更稀疏会在能力与可解释性之间进行权衡,而扩大模型规模可以改善能力-可解释性前沿。然而,在保持可解释性的同时,将稀疏模型扩展到数千万非零参数以上仍然是一个挑战。除了从头训练权重稀疏模型外,我们还展示了初步结果,表明我们的方法也可以适用于解释现有的稠密模型。我们的工作产生了达到前所未有的人类可理解性水平的回路,并以相当严格的方式对其进行了验证。
引用
@article{arxiv.2511.13653,
title = {Weight-sparse transformers have interpretable circuits},
author = {Leo Gao and Achyuta Rajaram and Jacob Coxon and Soham V. Govande and Bowen Baker and Dan Mossing},
journal= {arXiv preprint arXiv:2511.13653},
year = {2025}
}