通过白箱语言模型提升神经元级解释性
计算与语言
2025-02-28 v4 机器学习
摘要
自动回归语言模型(如GPT-2)中的神经元可通过分析其激活模式进行解释。近期研究表明,诸如字典学习这类后验稀疏编码技术可增强神经元级解释性。在我们的研究中,我们致力于通过在模型架构中嵌入稀疏编码来从根本上提高神经网络解释性,而非事后施加。我们引入一种名为Coding RAte TransformEr (CRATE)的白箱类Transformer架构,专为捕捉数据分布中稀疏、低维结构而设计。我们的全面实验显示,CRATE在多种评估指标上实现了最高可达103%的相对改进。详细调查确认,CRATE的解释性提升在不同层面稳定表现,无论模型规模如何,凸显了CRATE在增强神经网络解释性方面的稳健性能。进一步分析表明,CRATE的解释性提升源于其在相关标记上持续且具区分性地激活的能力。这些发现指向了创建卓越于神经元级解释的白箱基础模型的前景方向。
关键词
引用
@article{arxiv.2410.16443,
title = {Improving Neuron-level Interpretability with White-box Language Models},
author = {Hao Bai and Yi Ma},
journal= {arXiv preprint arXiv:2410.16443},
year = {2025}
}
备注
CPAL 2025 camera-ready version. Selected as Oral