EchoAtt:关注、复制再调整以实现更高效的大型语言模型
计算与语言
2025-10-28 v1 机器学习
摘要
大型语言模型(LLM)随着其深度和参数量的增加,在各类自然语言处理任务中展现出了卓越的性能。然而,这种规模的扩大也导致了计算需求的增加,尤其是在推理和微调阶段。为了应对这些挑战,我们引入了 EchoAtt,这是一种旨在通过分析和利用跨层注意力模式的相似性来优化基于 Transformer 模型的新框架。我们的分析表明,LLM 中的许多内部层,尤其是规模较大的模型,表现出高度相似的注意力矩阵。通过利用这种相似性,EchoAtt 允许在非关键层中共享注意力矩阵,在不损害性能的情况下显著降低了计算需求。我们将该方法结合到知识蒸馏设置中,由预训练的教师模型指导较小学生模型的训练。学生模型在相似度高的层中选择性共享注意力矩阵,同时从教师模型继承关键参数。我们在 TinyLLaMA-1.1B 上取得的最佳结果表明,EchoAtt 将推理速度提高了 15%,训练速度提高了 25%,并将参数量减少了约 4%,同时均提升了零样本性能。这些发现突显了注意力矩阵共享在提升 LLM 效率方面的潜力,使其更适用于实时和资源受限的应用。
引用
@article{arxiv.2409.14595,
title = {EchoAtt: Attend, Copy, then Adjust for More Efficient Large Language Models},
author = {Hossein Rajabzadeh and Aref Jafari and Aman Sharma and Benyamin Jami and Hyock Ju Kwon and Ali Ghodsi and Boxing Chen and Mehdi Rezagholizadeh},
journal= {arXiv preprint arXiv:2409.14595},
year = {2025}
}