中文

归一化窄跳跃至结论:用于参数高效提前退出 Transformer 预测的归一化窄捷径

人工智能 2024-10-04 v2

摘要

随着基于 Transformer 的大型语言模型规模和成本不断增长,近期,人们开始关注将 Transformer 早期的隐藏表示捷径映射到最终表示,以实现更低成本的模型推理。具体而言,通过对早期层进行线性变换来为预训练 Transformer 构建捷径,已被证明能够提高早期推理的精度。然而,对于大型语言模型,即便是这种方式也变得计算代价高昂。在本工作中,我们提出了窄跳跃至结论(Narrow Jump to Conclusions, NJTC)和归一化窄跳跃至结论(Normalized Narrow Jump to Conclusions, N-NJTC)——作为标准线性捷径的参数高效替代方案,可将捷径参数量减少 97% 以上。我们证明,N-NJTC 在早期阶段可靠地优于恒等捷径,并在 GPT-2-XL、Phi3-Mini 和 Llama2-7B Transformer 模型的所有 Transformer 块层级上提供稳定的精度,从而证明了更具参数高效性的捷径方法的可行性。

关键词

引用

@article{arxiv.2409.14091,
  title  = {Normalized Narrow Jump To Conclusions: Normalized Narrow Shortcuts for Parameter Efficient Early Exit Transformer Prediction},
  author = {Amrit Diggavi Seshadri},
  journal= {arXiv preprint arXiv:2409.14091},
  year   = {2024}
}