BOSCH:面向短上下文注意力头选择的黑箱二进制优化
计算与语言
2026-04-08 v1
摘要
后训练混合式大语言模型 (LLM) 通常用滑动窗口注意力 (SWA) 替代二次自注意力,以降低 KV 缓存消耗并提升延迟。现有混合方案通常在层级上定义(如交错)或在注意力头级别通过本地到全局的静态排序实现。层级方案忽略了局部和全局依赖通过同一层内的注意力头路由的事实,而静态注意力头级别排序则受到 entanglement 影响:注意力头的局部/全局行为在混合后可能发生变化。我们提出 BOSCH (Black-box Binary Optimization for Short-context Head Selection),一种训练无关的方法,将问题形式化为大邻域搜索,并分解为三个子问题:(i) 通过有限预算的黑箱探针实现层级重要性检测,(ii) 基于这些灵敏度进行自适应的每层 SWA 比例分配,(iii) 在比例槽位内进行分组的注意力头级优化。针对 4 个规模从 17 亿到 300 亿参数的 LLM,以及 4 种 SWA 比例,实验表明 BOSCH 在层级启发式方法和 6 种强大的静态注意力头级方法上均表现出色,特别是在更高的 SWA 比例下提升更显著。在持续预训练下,BOSCH 能更快且更高水平地恢复原始的长程上下文性能。对所选注意力头的分析显示,BOSCH 在不同 SWA 比例下呈现出显著的注意力头更替,凸显了针对每个目标比例进行注意力头级选择的重要性,而非依赖固定的局部性排序。
引用
@article{arxiv.2604.05942,
title = {BOSCH: Black-Box Binary Optimization for Short-Context Attention-Head Selection in LLMs},
author = {Abbas Ghaddar and Ivan Kobyzev and Boxing Chen and Yufei Cui},
journal= {arXiv preprint arXiv:2604.05942},
year = {2026}
}
备注
ACL 2026 (Main Conference)