探究GPT-2中的敏感方向:改进的基线与稀疏自编码器的比较分析
机器学习
2024-11-19 v2
摘要
敏感方向实验试图通过测量沿特定方向扰动激活值时下一词元预测概率的变化,来理解语言模型的计算特征。我们通过引入一个改进的扰动方向基线,扩展了敏感方向的研究工作。我们证明,与改进的基线相比,稀疏自编码器重建误差的KL散度不再异常地高。我们还表明,稀疏自编码器揭示的特征方向对模型输出的影响程度取决于其稀疏性,其中L0更低的稀疏自编码器特征方向影响更大。此外,我们发现,与传统稀疏自编码器相比,端到端稀疏自编码器的特征对模型输出的影响并未表现出更强的效果。
引用
@article{arxiv.2410.12555,
title = {Investigating Sensitive Directions in GPT-2: An Improved Baseline and Comparative Analysis of SAEs},
author = {Daniel J. Lee and Stefan Heimersheim},
journal= {arXiv preprint arXiv:2410.12555},
year = {2024}
}
备注
Presented at the Attributing Model Behavior at Scale (ATTRIB) and Scientific Methods for Understanding Deep Learning (SciForDL) workshops at NeurIPS 2024