中文

基于Matryoshka稀疏自编码器的多层特征学习

机器学习 2025-03-25 v1 人工智能

摘要

稀疏自编码器 (SAE) 已成为解释神经网络 by提取其激活中表示概念的强大工具。然而,选择SAE字典的大小(即学习的概念数量)会导致一种张力:随着字典大小增加以捕捉更多相关概念,稀疏激励会导致特征被分割或吸收到更具体的特征中,导致高层特征缺失或扭曲。我们引入Matryoshka SAEs,这是一种新型变体,通过同时训练多个嵌套字典(大小递增),迫使较小的字典在不使用较大字典的情况下独立重构输入。这将组织特征层次化——较小的字典学习通用概念,而较大的字典学习更具体的概念,无需吸收高层特征。我们在Gemma-2-2B和TinyStories上训练Matryoshka SAEs,发现其在稀疏探针和目标概念抹除任务上表现优异,概念表示更加解缠,特征吸收减少。尽管在重构性能上有轻微的tradeoff,但我们认为Matryoshka SAEs是实际任务的优越替代方案,因为它使能够训练任意大小的SAE,同时保留不同抽象水平上可解释的特征。

关键词

引用

@article{arxiv.2503.17547,
  title  = {Learning Multi-Level Features with Matryoshka Sparse Autoencoders},
  author = {Bart Bussmann and Noa Nabeshima and Adam Karvonen and Neel Nanda},
  journal= {arXiv preprint arXiv:2503.17547},
  year   = {2025}
}