Sorted LLaMA:释放大语言模型中间层在动态推理中的潜力
计算与语言
2024-02-12 v2 机器学习
摘要
大语言模型(LLMs)通过在理解和生成类人文本方面表现出色,彻底改变了自然语言处理(NLP)。然而,其广泛部署可能成本高昂。SortedNet 是一种近期的训练技术,通过利用网络中的模块化并以嵌套方式依据计算量/准确率对子模型排序,实现动态推理。我们将 SortedNet 扩展到生成式 NLP 任务,使大语言模型无需任何预训练即可实现动态化,仅需用 Sorted Fine-Tuning(SoFT)替代标准微调(SFT)。我们的方法提升了模型效率,消除了推理时针对不同场景需要多个模型的需求。我们表明,该方法能够释放 Transformer 中间层在生成目标输出方面的能力。我们的子模型仍是原始模型的组成部分,从而最小化存储需求以及不同计算/延迟预算间的切换成本。我们将该方法应用于在 Stanford Alpaca 数据集上微调 LLaMA 2 13B 以进行指令跟随,以及在 TriviaQA 上进行闭卷问答,证明了所提方法的有效性。结果表明,与标准微调和 SFT+ICT(Early-Exit)相比,子模型性能更优,且均通过高效微调实现,推理时无需额外内存占用。
引用
@article{arxiv.2309.08968,
title = {Sorted LLaMA: Unlocking the Potential of Intermediate Layers of Large Language Models for Dynamic Inference},
author = {Parsa Kavehzadeh and Mojtaba Valipour and Marzieh Tahaei and Ali Ghodsi and Boxing Chen and Mehdi Rezagholizadeh},
journal= {arXiv preprint arXiv:2309.08968},
year = {2024}
}
备注
Accepted to EACL 2024 - Findings