中文

通过强制有序性提升特征一致性

机器学习 2025-12-03 v1 人工智能

摘要

稀疏自编码器(Sparse Autoencoders, SAEs)因其在解释神经网络方面的作用而被广泛使用,但其学习到的特征常常因随机种子和超参数设置的不同而产生差异。我们引入有序稀疏自编码器(Ordered Sparse Autoencoders, OSAE),其扩展了Matryoshka SAEs,并(1)建立了潜在特征的严格排序,(2)确定性地使用每一个特征维度,避免了以往嵌套式 SAE 方法中基于抽样的近似。理论上,我们展示在稀疏字典学习中解唯一性(自然对称性除外)的设置下,OSAEs 能解决置换非唯一性问题。实验上,在 Gemma2-2B 和 Pythia-70M 上,我们证明 OSAEs 在 Matryoshka 基线上能提升一致性。

关键词

引用

@article{arxiv.2512.02194,
  title  = {Enforcing Orderedness to Improve Feature Consistency},
  author = {Sophie L. Wang and Alex Quach and Nithin Parsan and John J. Yang},
  journal= {arXiv preprint arXiv:2512.02194},
  year   = {2025}
}