Qwen-Scope:将稀疏特征转化为大型语言模型的开发工具
计算与语言
2026-05-13 v1 机器学习
摘要
大型语言模型在各类任务中展现出卓越的能力,但其内部决策过程在很大程度上仍不透明,这限制了我们检查、控制和系统性地改进它们的能力。这种不透明性推动了机制可解释性领域日益增多的研究,其中稀疏自编码器(SAE)已成为将模型激活分解为稀疏、可解释特征表示的最有前景的工具之一。我们推出了 Qwen-Scope,这是一个基于 Qwen 模型家族构建的开源 SAE 套件,包含来自 Qwen3 和 Qwen3.5 系列 7 个模型变体的 14 组 SAE,覆盖了稠密和混合专家架构。在这些 SAE 的基础上,我们展示了 SAE 可以超越事后分析,沿着四个方向作为模型开发的实用接口:(i)推理时引导,利用 SAE 特征方向在不修改模型权重的情况下控制语言、概念和偏好;(ii)评估分析,利用激活的 SAE 特征为基准冗余和能力覆盖提供表征层面的代理指标;(iii)以数据为中心的工作流,利用 SAE 特征支持多语言毒性分类和面向安全的数据合成;以及(iv)后训练优化,将 SAE 衍生的信号整合到监督微调和强化学习目标中,以减轻诸如语码转换和重复等不良行为。这些结果共同表明,SAE 不仅可以作为事后分析工具,还可以作为可复用的表征层面接口,用于诊断、控制、评估和改进大型语言模型。通过开源 Qwen-Scope,我们旨在支持机制研究,并加速将模型内部与下游行为联系起来的实用工作流。
引用
@article{arxiv.2605.11887,
title = {Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models},
author = {Boyi Deng and Xu Wang and Yaoning Wang and Yu Wan and Yubo Ma and Baosong Yang and Haoran Wei and Jialong Tang and Huan Lin and Ruize Gao and Tianhao Li and Qian Cao and Xuancheng Ren and Xiaodong Deng and An Yang and Fei Huang and Dayiheng Liu and Jingren Zhou},
journal= {arXiv preprint arXiv:2605.11887},
year = {2026}
}