中文

稀疏特征电路寻找:面向 in-context learning 的规模化方法

机器学习 2025-04-21 v1 人工智能 计算与语言

摘要

稀疏自编码器(SAEs)是解释大型语言模型激活活跃的流行工具,但其在解释性研究中的实际作用尚不明确。在本工作中,我们展示了其效用——通过 SAEs 深化对 in-context learning(ICL)机制背后原理的理解。我们识别出抽象 SAE 特征,分别用于(i)编码模型应执行哪项任务的知识,以及(ii)其潜在向量因果地诱导该任务零样本执行。这一现象与先前表明 ICL 通过任务向量中介的研究一致。我们进一步展示,这些任务向量可被稀疏 SAE 潜在向量的稀疏和良好近似所表示,包括这些任务执行特征。为探索 ICL 机制,我们将 Marks 等人(2024)的稀疏特征电路方法进行适配,使其适用于参数规模更大的 Gemma-1 2B 模型(参数规模是其10倍),以及更复杂的 ICL 任务。通过电路寻找,我们发现具有相应 SAE 潜在特征的任务检测特征——这些特征在提示词中更早激活,能够检测任务是否已被执行——它们通过注意力和 MLP 子层与任务执行特征之间存在因果关联。

关键词

引用

@article{arxiv.2504.13756,
  title  = {Scaling sparse feature circuit finding for in-context learning},
  author = {Dmitrii Kharlapenko and Stepan Shabalin and Fazl Barez and Arthur Conmy and Neel Nanda},
  journal= {arXiv preprint arXiv:2504.13756},
  year   = {2025}
}