中文

规模化单语义性:从Claude 3 Sonnet中提取可解释特征

人工智能 2026-05-29 v1

摘要

我们展示了稀疏自编码器能够从生产规模的语言模型Claude 3 Sonnet中提取可解释特征,这解决了字典学习方法是否能扩展到小型transformer之外的开放性问题。我们在该模型的中间层残差流上训练了最高达3400万特征的稀疏自编码器,并借助规模化法则指导超参数选择。得到的特征具有多语言性和多模态性(尽管仅用文本训练,却能泛化到图像),能响应具体实例和抽象概念讨论,并且可用于以与其解释一致的方式驾驭模型行为。我们发现对应著名实体和位置的特征,以及更抽象的概念如讽刺或代码错误的特征。我们还识别了与语言模型可能造成伤害相关的特征——包括代表欺骗、权力寻求、迎合和偏见的特征——并展示了这些特征在被操纵时会因果性地影响模型输出。此外,我们对特征的可解释性、几何和计算功能进行了分析。然而,仍存在显著局限性:我们的特征套组不完整,且缺乏评估方法以判断特征是否忠实地捕获模型计算。

关键词

引用

@article{arxiv.2605.29358,
  title  = {Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet},
  author = {Adly Templeton and Tom Conerly and Jonathan Marcus and Jack Lindsey and Trenton Bricken and Brian Chen and Adam Pearce and Craig Citro and Emmanuel Ameisen and Andy Jones and Hoagy Cunningham and Nicholas L Turner and Callum McDougall and Monte MacDiarmid and Alex Tamkin and Esin Durmus and Tristan Hume and Francesco Mosconi and C. Daniel Freeman and Theodore R. Sumers and Edward Rees and Joshua Batson and Adam Jermyn and Shan Carter and Chris Olah and Tom Henighan},
  journal= {arXiv preprint arXiv:2605.29358},
  year   = {2026}
}