稀疏自编码器适用于操控——前提是选对特征
机器学习
2025-12-23 v2 人工智能
计算与语言
摘要
稀疏自编码器(SAE)已被提出作为一种无监督方法,用于学习模型潜在空间的分解。这使得一些有用的应用成为可能,例如操控——即在无需标注数据的情况下,将模型的输出导向所需的概念。当前的方法通过分析激活SAE特征的输入词元来识别用于操控的特征。然而,近期研究指出,仅凭激活情况并不能完全描述一个特征对模型输出的影响。在本工作中,我们区分了两类特征:输入特征,主要捕获模型输入中的模式;以及输出特征,它们对模型的输出具有人类可理解的影响。我们提出了输入分数和输出分数来表征和定位这些类型的特征,并表明在同一特征中,两种分数的高值很少同时出现。这些发现具有实际意义:在滤除低输出分数的特征后,我们使用SAE进行操控时获得了2到3倍的改进,使其与监督方法相比具有竞争力。
引用
@article{arxiv.2505.20063,
title = {SAEs Are Good for Steering -- If You Select the Right Features},
author = {Dana Arad and Aaron Mueller and Yonatan Belinkov},
journal= {arXiv preprint arXiv:2505.20063},
year = {2025}
}