LoRA 适配器的特征几何:稀疏自编码器对表示差异的分析
机器学习
2026-05-29 v1
摘要
低秩适应(LoRA)已成为适应大语言模型的广泛采用的方法,但 LoRA 微调诱导的内部表征变化仍不充分理解。在本工作中,我们使用稀疏自编码器(SAE)探讨 LoRA 诱导的表征几何。我们引入一种 delta 激活框架,以隔离适配器特定贡献对残差流的贡献。使用Gemma-2-9B的 LoRA 秩 4、8、16 和 32,我们在多个 transformer 层上训练适配器特定的 SAE,并将其学习的特征空间与预训练 SAE 字典进行比较。我们使用解码器方向的余弦相似性、特征子空间的主角分析以及激活表征之间的中心核对齐(CKA)来评估表征对齐。在层和秩之间,我们一致观察到 LoRA 诱导的特征字典与预训练 SAE 特征之间的几何对齐较弱。适配器特定的 SAE 也比预训练 SAE 更有效地重构 delta 激活,这表明 LoRA 更新在残差流中占据部分独立的表征结构。此外,特征密度随秩和深度增加,而几何分离在不同秩之间保持相对稳定。这些发现提供了 LoRA 微调可能诱导出预训练可解释性字典无法完全捕获的特征结构的实证证据,这对机制可解释性、适应性分析和安全审计都有重要影响。
引用
@article{arxiv.2605.28896,
title = {Feature Geometry of LoRA Adapters: A Sparse Autoencoder Analysis of Representational Divergence in Fine-Tuned Language Models},
author = {Prasanth K K},
journal= {arXiv preprint arXiv:2605.28896},
year = {2026}
}