SCALPEL:基于低秩参数编辑的选择性能力削减用于大语言模型可解释性分析
机器学习
2026-01-13 v1 人工智能
计算与语言
摘要
大语言模型在 diverse domains 中表现出色,但由于对其内部机制的理解不完全,其在医疗保健、法律系统和自主决策系统中的部署仍受限。随着这些模型集成到高风险系统中,理解它们如何编码能力已成为可解释性研究的基本问题。传统方法通过梯度归因或激活分析来识别重要模块,假设特定能力映射到特定组件。然而,这简化了神经计算:模块可能同时 contribute to multiple capabilities,而单个能力可能分布在多个模块中。这些粗糙的分析未能捕捉到精细且分布式的能力编码。我们提出了SCALPEL(Selectivity Capability Ablation via Low-rank Parameter Editing for Large language models),一种将能力表示为低秩参数子空间的框架,而非离散模块。我们的关键洞察是,能力可以由低秩修改在各层和模块中分布来 characterize,通过训练LoRA适配器来减少区分正确答案与错误答案的差异,同时保持一般语言建模质量,SCALPEL识别负责特定能力的低秩表示,而保持与其他能力的 disentangled。广泛的来自BLiMP的各种能力和语言任务实验表明,SCALPEL成功地移除了目标能力而保留了一般能力,为能力在参数空间中的分布提供了精细洞察。结果表明,能力具有低秩结构,并且可以通过针对性的参数空间干预进行选择性削减,为理解大语言模型中的能力编码提供了细致的认识。
引用
@article{arxiv.2601.07411,
title = {SCALPEL: Selective Capability Ablation via Low-rank Parameter Editing for Large Language Model Interpretability Analysis},
author = {Zihao Fu and Xufeng Duan and Zhenguang G. Cai},
journal= {arXiv preprint arXiv:2601.07411},
year = {2026}
}