SAE作为空屏:无需训练即可预测LLM跨域迁移性的可解释特征
人工智能
2026-03-04 v1
摘要
近年来,预训练大型语言模型在各类任务上取得了显著成功。除了自监督预训练的关键作用外,其在下游应用中的效果还高度依赖于后训练过程——该过程会针对特定任务的数据和目标进行适配。然而,这一过程不可避免地会引入模型偏移,这些偏移可能影响不同领域中的性能,而如何将这些偏移进行迁移仍鲜有了解。为揭开黑箱,我们提出了基于稀疏自编码器的迁移得分(SAE-based Transferability Score, STS),这是一种新型指标,利用稀疏自编码器(SAEs)来预测后训练的迁移性。以监督微调为例,STS识别SAE表示中发生偏移的维度,并计算其与下游领域的相关性,从而在微调前实现可靠的迁移性估计。跨多个模型和领域的大量实验表明,STS能够准确预测监督微调的迁移性,其与实际性能变化的皮尔逊相关系数高达0.7以上。除此之外,我们首次将STS扩展至强化学习。我们认为,STS可以作为一种可解释的工具,用于指导LLMs的后训练策略。代码已公开于 https://github.com/PKU-ML/STS。
引用
@article{arxiv.2603.02908,
title = {SAE as a Crystal Ball: Interpretable Features Predict Cross-domain Transferability of LLMs without Training},
author = {Qi Zhang and Yifei Wang and Xiaohan Wang and Jiajun Chai and Guojun Yin and Wei Lin and Yisen Wang},
journal= {arXiv preprint arXiv:2603.02908},
year = {2026}
}