对大语言模型中数据无关关键层的谱洞察
机器学习
2025-06-06 v2 计算与语言
摘要
理解大语言模型(LLM)中特征表示如何跨层演化是提升其可解释性和鲁棒性的关键。尽管近期的研究已识别出与特定功能或行为相关的关键层,但这些工作通常依赖于微调模型的数据相关分析,限制了它们在事后设置中的应用。相反,我们引入了一种数据无关的方法,通过中心核对齐(CKA)分析表示动态,以识别预微调 LLM 中的内在关键层。我们表明,在表示空间中发生显著偏移的层也是微调期间受影响最大的层——这一模式对于给定模型在不同任务上保持一致。我们的谱分析进一步揭示,这些偏移由顶部主成分的变化驱动,这些变化编码了从理据到结论的语义转换。我们进一步将这些发现应用于两个实际场景:高效的领域适应,其中微调关键层比非关键层带来更大的损失降低;以及后门防御,其中冻结关键层可使攻击成功率降低高达 40%。
引用
@article{arxiv.2506.00382,
title = {Spectral Insights into Data-Oblivious Critical Layers in Large Language Models},
author = {Xuyuan Liu and Lei Hsiung and Yaoqing Yang and Yujun Yan},
journal= {arXiv preprint arXiv:2506.00382},
year = {2025}
}
备注
Accepted by Findings of ACL2025