机械可解释性中的自适应电路行为与泛化
机器学习
2024-12-06 v2 人工智能
计算与语言
摘要
机械可解释性旨在通过识别电路——大型神经网络中实现特定任务所需算法的最小子图来理解大型神经网络的内部工作原理。这些电路通常使用狭义定义的提示格式进行发现和分析。然而,鉴于大型语言模型 (LLM) 能够针对相同任务的各种提示格式进行泛化,仍不清楚这些电路的泛化程度如何。例如,仍不清楚模型的泛化是源于重复使用相同的电路组件、组件行为不同,还是使用完全不同的组件。本文我们针对 GPT-2 small 中已被广泛研究并被认为实现简单可解释算法的间接对象识别 (IOI) 电路进行泛化性研究。我们评估了其在挑战该算法假设的提示变体上的性能。我们的发现表明,该电路的泛化性 surprisingly 良好,通过复用其所有组件和机制仅添加额外的输入边来实现。值得注意的是,该电路即使在原始算法应失效的提示变体下也能泛化;我们发现一种解释此现象的机制,称为 S2 Hacking。我们的发现表明,LLM 中的电路可能比此前所认识的更灵活且更通用,凸显了研究电路泛化性以更好地理解这些模型更广泛能力的重要性。
引用
@article{arxiv.2411.16105,
title = {Adaptive Circuit Behavior and Generalization in Mechanistic Interpretability},
author = {Jatin Nainani and Sankaran Vaidyanathan and AJ Yeung and Kartik Gupta and David Jensen},
journal= {arXiv preprint arXiv:2411.16105},
year = {2024}
}
备注
10 pages, 8 figures