监督微调机理研究
人工智能
2026-05-13 v1
摘要
大型语言模型在监督微调(SFT)前后的隐藏激活之间的余弦相似度仍然非常高。这乍看之下表明SFT在很大程度上未改变模型的激活几何结构。然而,通过在基础模型上预训练的稀疏自编码器(SAE)对两组激活进行投影,揭示了底层的稀疏潜变量存在显著差异。我们引入了一种新颖的研究流程,利用这些预训练的SAE作为高分辨率诊断工具,从机理上研究这种表征差异的驱动因素。通过我们的分析流程,我们发现了在监督微调过程中被系统性改变的精确语义特征的任务特定和层级特定分布。我们还识别出了一个特定于安全对齐的逐层更新模式。与这项工作相关的所有代码、实验脚本和分析文件均可在以下链接公开获取:https://github.com/ruhzi/sae-investigation。
引用
@article{arxiv.2605.11426,
title = {A Mechanistic Investigation of Supervised Fine Tuning},
author = {Ruhaan Chopra},
journal= {arXiv preprint arXiv:2605.11426},
year = {2026}
}