单语义性扩展:从Claude 3 Sonnet中提取可解释特征
人工智能
2026-05-29 v1 机器学习
编程语言
摘要
我们展示了稀疏自编码器可从生产规模的语言模型Claude 3 Sonnet中提取可解释特征,既回答了稀疏字典学习方法是否能扩展到小型变压器之外的开放性问题。我们在该模型中间层残差流上训练了最高达3400万特征的稀疏自编码器,利用扩展规律指导超参数选择。得到的特征具有多语言性和多模态性(尽管仅用文本训练,却可推广至图像),能响应具体实例和抽象概念讨论,并且可用于以其解释方式为导向来操控模型行为。我们发现对应著名人物和地点的特征,以及更抽象的概念,如讽刺或代码中的错误。我们还识别了可能导致语言模型有害影响的特征——包括代表欺骗、权力寻求、谄媚和偏见的特征——并展示了这些特征在被操控时对模型输出具有因果影响。此外,我们对特征的可解释性、几何和计算功能进行了分析。然而,仍存在显著局限性:我们的特征集合不完整,且缺乏评估特征是否忠实捕获模型计算的严格方法。
引用
@article{arxiv.2605.29357,
title = {PassNet: Scaling Large Language Models for Graph Compiler Pass Generation},
author = {Yiqun Liu and Yingsheng Wu and Ruqi Yang and Enrong Zheng and Honglei Qiu and Sijun He and Tai Liang and Jingjing Wu and Yuhan Zhou and Yiwei Zhang and Dongyan Chen and Weihan Yi and Xinqi Li and Siqi Bao},
journal= {arXiv preprint arXiv:2605.29357},
year = {2026}
}
备注
Code and data available at https://github.com/PaddlePaddle/PassNet