InverseScope:用于解释大型语言模型的可扩展激活反向投影
机器学习
2025-09-30 v2 人工智能
摘要
理解大型语言模型(LLM)内部表示是解释性研究中的核心挑战。现有的特征解释方法常依赖于表示结构的强假设,而这些假设在实际中可能不成立。本文引入InverseScope,一个轻度假设且可扩展的框架,通过输入反向投影来解释神经激活。给定目标激活,我们定义一个生成相似激活的输入分布,并分析该分布以推断编码信息。为解决高维空间中抽样效率低的问题,本文提出一种新型条件生成架构,显著提升了样本效率。进而引入定量评估协议,通过在抽样输入上计算的特征一致性率来测试解释性假设。InverseScope将基于反向投影的解释方法扩展至更大的模型和实际任务,实现对现实大型语言模型内部表示的系统性和定量分析。
引用
@article{arxiv.2506.07406,
title = {InverseScope: Scalable Activation Inversion for Interpreting Large Language Models},
author = {Yifan Luo and Zhennan Zhou and Bin Dong},
journal= {arXiv preprint arXiv:2506.07406},
year = {2025}
}
备注
18 pages, 9 figures