真实场景中的可解释性:GPT-2 small 中用于间接宾语识别的回路
机器学习
2022-11-02 v1 人工智能
计算与语言
摘要
机制可解释性研究旨在从机器学习模型内部组件的角度解释其行为。然而,以往大多数工作要么聚焦于小模型中的简单行为,要么以宽泛方式描述较大模型中的复杂行为。在这项工作中,我们弥合了这一差距,给出了 GPT-2 small 如何执行称为间接宾语识别(IOI)的自然语言任务的解释。我们的解释涵盖分为 7 个主要类别的 26 个注意力头,这些是通过结合依赖因果干预的可解释性方法发现的。据我们所知,该调查是在语言模型中“在真实场景下”对自然行为进行逆向工程的最大端到端尝试。我们使用三个定量标准——忠实性、完备性和最小性——来评估我们解释的可靠性。尽管这些标准支持我们的解释,但它们也指出了我们理解中尚存的差距。我们的工作提供了证据表明,对大型 ML 模型的机制性理解是可行的,为将我们的理解扩展到更大模型与更复杂任务带来了机遇。
引用
@article{arxiv.2211.00593,
title = {Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small},
author = {Kevin Wang and Alexandre Variengien and Arthur Conmy and Buck Shlegeris and Jacob Steinhardt},
journal= {arXiv preprint arXiv:2211.00593},
year = {2022}
}