Hopscotch:发现并跳过语言模型中的冗余
计算与语言
2025-09-16 v2 人工智能
机器学习
摘要
现代因果语言模型堆叠大量注意力块以提升性能,但并非所有注意力块对每个任务都是必需的。我们提出 Hopscotch 方法,通过识别贡献最小的注意力块并适当跳过以保持输出质量。Hopscotch 联合优化哪些块可被跳过以及如何缩放剩余层的输出。通过引入轻量可训练缩放参数于注意力与 MLP 模块,可缓解因移除注意力块而导致的隐藏状态分布偏移。Hopscotch 不修改模型权重,也无需访问预训练或指令微调数据,与现有模型压缩技术兼容。应用于 和 时,Hopscotch 即使跳过四个注意力块,性能下降也不足 2%。
引用
@article{arxiv.2506.03303,
title = {Hopscotch: Discovering and Skipping Redundancies in Language Models},
author = {Mustafa Eyceoz and Nikhil Shivakumar Nayak and Hao Wang and Ligong Han and Akash Srivastava},
journal= {arXiv preprint arXiv:2506.03303},
year = {2025}
}
备注
10 pages, 4 figures, 9 tables