FineScope:SAE 引导的数据选择实现领域特定的大语言模型剪枝与微调
计算与语言
2026-03-02 v3 人工智能
摘要
从头训练大型语言模型(LLM)需要大量的计算资源,这推动了人们对开发保持高效与强任务性能的较小领域特定 LLM 的兴趣。中等规模的模型(如 LLaMA)已被用作领域特定适应的起点,但在专业数据集上进行测试时,它们常会出现精度下降的问题。我们引入了 FineScope,这是一个从较大的预训练模型中推导出紧凑的、领域优化 LLM 的框架。FineScope 利用稀疏自编码器(SAE)框架,受其产生可解释特征表示能力的启发,从大型数据集中提取领域特定子集。我们应用带有领域特定约束的结构化剪枝,以确保生成的剪枝模型保留目标领域的基本知识。为了进一步提升性能,这些剪枝模型经历了自数据蒸馏,利用 SAE 精选的数据集来恢复在剪枝过程中丢失的关键领域特定信息。大量实验与消融研究表明,FineScope 实现了极具竞争力的性能,在领域特定任务中优于多个大规模 SOTA LLM。此外,我们的结果表明,当使用 SAE 精选的数据集进行微调时,FineScope 使剪枝模型能够恢复其原始性能的很大一部分。进一步地,将这些数据集应用于微调未经剪枝的预训练 LLM,同样提高了它们的领域特定精度,凸显了我们方法的鲁棒性。
引用
@article{arxiv.2505.00624,
title = {FineScope : SAE-guided Data Selection Enables Domain Specific LLM Pruning and Finetuning},
author = {Chaitali Bhattacharyya and Hyunsei Lee and Junyoung Lee and Shinhyoung Jang and Il hong Suh and Yeseong Kim},
journal= {arXiv preprint arXiv:2505.00624},
year = {2026}
}