重访端到端稀疏自编码器训练:一次微调就足够了
机器学习
2025-04-01 v2
摘要
稀疏自编码器(SAE)广泛用于解释语言模型激活。关键评估指标是替换模型激活为SAE重构后的模型logits与原始模型logits之间的交叉熵损失增加。通常情况下,SAE仅在重建预计算、随机化的激活时使用均方误差(MSE)进行训练。最近的工作引入了结合KL散度和MSE的训练方法(“端到端”SAE),显著提高了重构精度,但计算成本大幅增加,限制了其广泛采用。我们提出了仅在最终2500万训练标记上进行一次简短的KL+MSE微调(仅占通常训练预算的几 percent),即可实现可比的改进,减少20-50%的交叉熵损失间隙,同时几乎不增加额外计算成本。我们进一步发现,KL微调、LoRA适配器和线性适配器等多种微调方法均可实现类似的、非叠加的交叉熵改进,这表明MSE训练的SAE中存在一种常见的、易于纠正的错误来源。我们展示了一种简便的方法,用于在训练阶段有效地传递超参数和稀疏性惩罚,尽管KL和MSE损失之间的尺度差异。虽然ReLU和TopK SAE都实现了显著的交叉熵损失改进,但在监督SAEBench指标的评估结果呈现出混合态,具体取决于SAE架构和下游任务。尽管如此,我们的方法可能在诸如电路分析等可解释性应用中提供有意义的改进,同时成本极低。
引用
@article{arxiv.2503.17272,
title = {Revisiting End-To-End Sparse Autoencoder Training: A Short Finetune Is All You Need},
author = {Adam Karvonen},
journal= {arXiv preprint arXiv:2503.17272},
year = {2025}
}
备注
v2: Improve clarity of Figure 1 and Abstract, add reference to anthropic circuits work