Decoder-only Transformer 中的动态层选择
计算与语言
2024-10-29 v1 机器学习
摘要
大型语言模型(LLM)庞大的规模促使人们寻求推理优化方法。一种有效的方法是动态推理,它根据当前样本调整架构以降低整体计算成本。我们实证检验了自然语言生成(NLG)的两种常见动态推理方法:层跳过和提前退出。我们发现,与提前退出相比,预训练的 decoder-only 模型对通过层跳过进行的层移除具有显著更强的鲁棒性。我们展示了在层跳过中使用隐藏状态信息来逐 token 适应计算的困难性。最后,我们通过构建一个预言机控制器表明,逐序列的动态计算分配有望带来显著的效率提升。值得注意的是,我们发现存在一种分配方式,仅平均使用 23.3% 的层即可达到与完整模型相当的性能。
引用
@article{arxiv.2410.20022,
title = {Dynamic layer selection in decoder-only transformers},
author = {Theodore Glavas and Joud Chataoui and Florence Regol and Wassim Jabbour and Antonios Valkanas and Boris N. Oreshkin and Mark Coates},
journal= {arXiv preprint arXiv:2410.20022},
year = {2024}
}