中文

AxBench:哪怕是简单的基线也超越稀疏自编码器

计算与语言 2025-03-05 v3 人工智能 机器学习

摘要

对语言模型输出进行细粒度的控制对于确保安全性和可靠性至关重要。提示工程和微调是广泛用于实现这一目标的方法,但解释性研究者提出了各种基于表示的技术,包括稀疏自编码器(SAEs)、线性人工断层、监督式驾驶向量、线性探针和表示微调。目前尚无基准用于在这些提议方法之间进行直接比较。因此,我们引入了AxBench,一个大规模的驾驶和概念检测基准,对Gemma-2-2B和9B模型进行实验。对于驾驶任务,我们发现提示工程超过了所有现有方法,随后是微调。对于概念检测,基于表示的方法(如差分均值)表现最佳。在两项评估中,SAEs并不具竞争力。我们提出了一种新颖的弱监督表示方法(Rank-1 Representation Finetuning;ReFT-r1),在两项任务中均表现出竞争力,同时提供了提示工程所不具备的解释性优势。除了AxBench外,我们还公开发布了用于ReFT-r1和DiffMean的SAE规模特征词典。

关键词

引用

@article{arxiv.2501.17148,
  title  = {AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders},
  author = {Zhengxuan Wu and Aryaman Arora and Atticus Geiger and Zheng Wang and Jing Huang and Dan Jurafsky and Christopher D. Manning and Christopher Potts},
  journal= {arXiv preprint arXiv:2501.17148},
  year   = {2025}
}