CRaSh:聚类、移除与共享增强无需完整大语言模型的微调
计算与语言
2023-10-25 v1
摘要
指令微调近来被公认为一种将大语言模型(LLMs)对齐以提升其跨任务泛化能力的有效方法。然而,当使用私有指令数据微调公开可访问的集中式LLM时,隐私问题不可避免。虽然模型间参数化模块的直接迁移是解决此问题的一种合理途径,但其影响与有效性仍需进一步探索。本文关注Offsite-Tuning(OFT),一种在集中式LLM与下游仿真器之间迁移transformer块的代表性技术。鉴于对OFT底层机制理解有限,我们从表示与功能相似性的角度对LLM进行实证分析。有趣的是,我们的发现揭示了LLM层内一种独特的模块化结构,其似乎随模型规模扩大而浮现。同时,我们注意到各层间表示与中间预测的细微但可能显著的变化。受这些观察启发,我们提出CRaSh,即聚类(Clustering)、移除(Removing)与共享(Sharing),一种无需训练的策略,用于从LLM派生改进的仿真器。CRaSh显著提升了数十亿参数规模下OFT的性能。此外,我们通过损失景观的视角,研究了含完整模型与不含完整模型微调所产生的最优解。我们的发现证明了这些最优解之间存在线性连通性,且落在同一 basin 中,从而凸显了CRaSh与OFT的有效性。源代码公开于 https://github.com/TsinghuaC3I/CRaSh。
引用
@article{arxiv.2310.15477,
title = {CRaSh: Clustering, Removing, and Sharing Enhance Fine-tuning without Full Large Language Model},
author = {Kaiyan Zhang and Ning Ding and Biqing Qi and Xuekai Zhu and Xinwei Long and Bowen Zhou},
journal= {arXiv preprint arXiv:2310.15477},
year = {2023}
}
备注
Accepted to EMNLP 2023 (Main Conference)