InversionView:解码神经激活信息的通用方法
机器学习
2024-11-05 v4 人工智能
计算与语言
摘要
如果我们能够充分解码神经网络激活中编码的信息,便能更好地理解神经网络的内部工作原理。本文我们认为,这些信息体现在导致相似激活的输入子集中。我们提出的 InversionView 方法通过从训练好的解码器模型中受激活条件抽样,来实际检查这一子集。这有助于揭示激活向量中的信息内容,并促进对 transformer 模型实现算法的理解。我们 presenting 四个案例研究,其中我们调查的模型范围从小型 transformer 到 GPT-2。在这些研究中,我们展示 InversionView 能够揭示激活中包含的清晰信息,包括关于上下文中出现标记的基本信息,以及更复杂的信息,如特定标记的计数、相对位置以及关于主题的抽象知识。我们还提供了经因果验证确认的电路以确认解码信息。
引用
@article{arxiv.2405.17653,
title = {InversionView: A General-Purpose Method for Reading Information from Neural Activations},
author = {Xinting Huang and Madhur Panwar and Navin Goyal and Michael Hahn},
journal= {arXiv preprint arXiv:2405.17653},
year = {2024}
}
备注
NeurIPS 2024; ICML 2024 Mechanistic Interpretability Workshop oral