中文

面向稀疏自编码器(SAE)的分布感知特征选择

机器学习 2025-09-01 v1

摘要

稀疏自编码器(SAE)将神经激活分解为可解释特征。广泛采用的变体TopK SAE从其K个最活跃特征中重构每个 token。然而,这种方法效率不高,因为某些 token携带的知识信息更多。BatchTopK通过在一批 token中选择最高激活来克服这一限制。这一方法改进了平均重构,但风险是“激活抽奖”,即稀有高幅度特征挤占了更多信息但幅度较低的特征。为解决这一问题,我们引入Sampled-SAE:通过对批量激活矩阵的列(代表特征)进行评分(使用L2范数或熵),形成大小为Kl的候选池,然后对来自受限特征池中来的所有 token进行Top-K选择。变更l的值可在批级选择与token特定选择之间梯度化。当l=1时,token仅从K个全局有影响力的特征中绘制;而较大的l则将候选池扩展至标准BatchTopK及更广泛的跨batch的token特定特征。较小的l强制全局一致性;较大的l更倾向于精细的重构。在Pythia-160M模型上,没有单个l值在所有指标上都最优:最佳选择取决于共享结构、重构忠实度和下游性能之间的权衡。Sampled-SAE因此将BatchTopK重新定义为一个可调的、分布感知的系列。

关键词

引用

@article{arxiv.2508.21324,
  title  = {Distribution-Aware Feature Selection for SAEs},
  author = {Narmeen Oozeer and Nirmalendu Prakash and Michael Lan and Alice Rigg and Amirali Abdullah},
  journal= {arXiv preprint arXiv:2508.21324},
  year   = {2025}
}