中文

Hopscotch:发现并跳过语言模型中的冗余

计算与语言 2025-09-16 v2 人工智能 机器学习

摘要

现代因果语言模型堆叠大量注意力块以提升性能,但并非所有注意力块对每个任务都是必需的。我们提出 Hopscotch 方法,通过识别贡献最小的注意力块并适当跳过以保持输出质量。Hopscotch 联合优化哪些块可被跳过以及如何缩放剩余层的输出。通过引入轻量可训练缩放参数于注意力与 MLP 模块,可缓解因移除注意力块而导致的隐藏状态分布偏移。Hopscotch 不修改模型权重,也无需访问预训练或指令微调数据,与现有模型压缩技术兼容。应用于 Llama-3.1-8B\texttt{Llama-3.1-8B}Qwen2.5-7B\texttt{Qwen2.5-7B} 时,Hopscotch 即使跳过四个注意力块,性能下降也不足 2%。

关键词

引用

@article{arxiv.2506.03303,
  title  = {Hopscotch: Discovering and Skipping Redundancies in Language Models},
  author = {Mustafa Eyceoz and Nikhil Shivakumar Nayak and Hao Wang and Ligong Han and Akash Srivastava},
  journal= {arXiv preprint arXiv:2506.03303},
  year   = {2025}
}

备注

10 pages, 4 figures, 9 tables