中文

FaithfulSAE:无需外部数据集依赖的稀疏自编码器忠实特征捕获

机器学习 2025-06-24 v1 人工智能 计算与语言

摘要

稀疏自编码器 (SAE) 已成为将大型语言模型表示分解为可解释特征的有前景的解决方案。然而,Paulo 和 Belrose (2025) 强调了不同初始化种子间的不稳定性,Heap 等人 (2025) 指出 SAE 可能无法捕获模型内部特征。这些问题可能源于在外部数据集上训练 SAE——这些数据集从网络收集或由另一个模型生成——可能包含超出模型泛化能力的分布外 (OOD) 数据。这可能导致产生幻觉式的 SAE 特征,我们称之为“伪特征”,它们错误地表示了模型的内部激活。为了解决这些问题,我们提出了 FaithfulSAE,一种在模型自身合成数据集上训练 SAE 的方法。使用 FaithfulSAE,我们证明了在较少 OOD 的指令数据集上训练 SAE 可使 SAE 在不同种子间更加稳定。值得注意的是,FaithfulSAE 在 SAE 探测任务中优于在基于网络的数据集上训练的 SAE,并且在 7 个模型中的 5 个中表现出更低的伪特征比例。总体而言,我们的方法消除了对外部数据集的依赖,通过更好地捕获模型内部特征来推进可解释性,同时强调了经常被忽视的 SAE 训练数据集的重要性。

关键词

引用

@article{arxiv.2506.17673,
  title  = {FaithfulSAE: Towards Capturing Faithful Features with Sparse Autoencoders without External Dataset Dependencies},
  author = {Seonglae Cho and Harryn Oh and Donghyun Lee and Luis Eduardo Rodrigues Vieira and Andrew Bermingham and Ziad El Sayed},
  journal= {arXiv preprint arXiv:2506.17673},
  year   = {2025}
}

备注

18 pages, 18 figures