稳定性蕴含冗余性:Delta 注意力选择性中止以提高长情境填充效率
人工智能
2026-05-27 v2
摘要
长情境填充的计算成本是大型语言模型 (LLM) 和大型多模态模型 (LMM) 的重要瓶颈。虽然 token 剪枝可减少序列长度,但先前方法依赖于启发式方法,与 FlashAttention 等硬件高效内核不兼容。本文我们观察到 token 向“语义固定点”演化,使得进一步处理冗余。为此,我们引入 Delta Attention Selective Halting (DASH),一种无训练策略,通过监控自注意力机制的层级更新动力学来选择性中止已稳定的 token。广泛的评估确认,DASH 在语言和视觉基准测试中都具有良好概括性,在保持模型准确性和硬件效率的同时显著加快 prefill 速度。代码将在 https://github.com/verach3n/DASH.git 发布。
引用
@article{arxiv.2604.18103,
title = {Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling},
author = {Yujie Chen and Tailai Chen and Yifeng Gao and Zoe Wanying He and Yijue Xu and Shaobo Wang and Linfeng Zhang},
journal= {arXiv preprint arXiv:2604.18103},
year = {2026}
}
备注
Accepted to ACL 2026 main conference