Aletheia:面向跨架构的高效 LoRA 微调的梯度引导层选择
机器学习
2026-04-20 v1 计算与语言
摘要
低秩适应(LoRA)已成为大型语言模型最主流的参数高效微调方法,但标准做法不考虑各 transformer 层对下游任务的相关性,统一应用于所有层。我们提出Aletheia,一种梯度引导的层选择方法,通过轻量级梯度探针识别最具任务相关性的层,并对这些层进行非对称秩分配的 LoRA 适配器。跨越 81 项实验,覆盖 14 个来自 8 个架构族(0.5B-72B 参数,包括稠密和混合专家架构),以及 Campaign 2 中一个额外记录的失败 Pythia/GPT-NeoX 尝试,Aletheia 在 MMLU、GSM8K 和 HumanEval 基准套件上实现了 15-28% 的训练加速(平均 23.1%,p < 0.001),且额外遗忘受到控制,下游行为与评估结果相符。在所测试的架构和规模方面,Campaign 1 显示 100% 的模型速度获胜率,Campaign 2 显示在受限退化框架下基本保留下游行为。总的来说,这些结果支持一种实用的模型经济学论点:智能的层选择可以在不引入重大下游损伤的前提下,使 LoRA 微调在evaluated set 上材质上更高效。
引用
@article{arxiv.2604.15351,
title = {Aletheia: Gradient-Guided Layer Selection for Efficient LoRA Fine-Tuning Across Architectures},
author = {Abdulmalek Saket},
journal= {arXiv preprint arXiv:2604.15351},
year = {2026}
}
备注
11 pages, 5 figures, 2 frozen evidence campaigns, 81 experiment rows across 14 successful models and 8 architecture families, plus one documented failed Pythia/GPT-NeoX attempt