稀疏自编码器表征中的特征竞争:大语言模型中不确定性驱动特征竞争的机制研究
机器学习
2026-05-12 v1 计算与语言
摘要
稀疏自编码器(Sparse Autoencoders, SAEs)将大语言模型表征分解为可解释的特征,但这些特征在不确定性下如何相互作用仍知之甚少。我们引入了特征竞争(Feature Rivalry)——即负相关的 SAE 特征对——并利用 Gemma Scope SAE,在 Gemma-2-2B 模型中研究竞争是否作为模型不确定性的机制性标志。通过在 PopQA 数据集上按响应熵划分的受控域内实验,我们发现,相对于低熵问题,高熵问题在第 0 层和第 12 层产生了显著更强的特征竞争(分别为 p=5.3×10^-26 和 p=5.8×10^-5),从而将不确定性定位到残差流中的特定处理阶段。随后,我们通过沿竞争轴进行激活引导,测试竞争是否在因果上位于模型输出的上游——结果发现,在 20 对竞争特征对中的 15 对上,在低引导乘数下,沿竞争方向(vec_A - vec_B)的引导比随机方向引起更多的输出变化。最后,基于活跃 SAE 特征解码器向量的成对余弦相似度计算的逐提示竞争分数,能够预测答案的正确性(AUROC=0.689),接近但未达到 softmax 置信度的预测水平(AUROC=0.808)。
引用
@article{arxiv.2605.08149,
title = {Feature Rivalry in Sparse Autoencoder Representations: A Mechanistic Study of Uncertainty-Driven Feature Competition in LLMs},
author = {Harshavardhan},
journal= {arXiv preprint arXiv:2605.08149},
year = {2026}
}
备注
10 pages, 6 figures