通过强制有序性提升特征一致性
机器学习
2025-12-03 v1 人工智能
摘要
稀疏自编码器(Sparse Autoencoders, SAEs)因其在解释神经网络方面的作用而被广泛使用,但其学习到的特征常常因随机种子和超参数设置的不同而产生差异。我们引入有序稀疏自编码器(Ordered Sparse Autoencoders, OSAE),其扩展了Matryoshka SAEs,并(1)建立了潜在特征的严格排序,(2)确定性地使用每一个特征维度,避免了以往嵌套式 SAE 方法中基于抽样的近似。理论上,我们展示在稀疏字典学习中解唯一性(自然对称性除外)的设置下,OSAEs 能解决置换非唯一性问题。实验上,在 Gemma2-2B 和 Pythia-70M 上,我们证明 OSAEs 在 Matryoshka 基线上能提升一致性。
引用
@article{arxiv.2512.02194,
title = {Enforcing Orderedness to Improve Feature Consistency},
author = {Sophie L. Wang and Alex Quach and Nithin Parsan and John J. Yang},
journal= {arXiv preprint arXiv:2512.02194},
year = {2025}
}