FlashPrefill:面向超长上下文填充的即时模式发现与阈值化
计算与语言
2026-03-09 v1 人工智能
摘要
长上下文建模是大语言模型的关键能力,但注意力的二次复杂度仍是关键瓶颈,尤其是在计算密集型的填充阶段。虽然已探索多种稀疏注意力机制,但它们通常要么搜索延迟较大,要么稀疏性不足。本文提出FlashPrefill,一种通过即时模式发现与阈值化实现超高速填充的框架。FlashPrefill利用快速块搜索技术同时定位动态垂直、斜切和块稀疏注意力模式。关键在于引入动态阈值机制,既无需排序或累积注意力得分,又能有效消除长尾分布以提升稀疏性。广泛评估表明,FlashPrefill在效率上实现了显著跃迁,在256K序列上实现前所未有的27.78倍加速。值得注意的是,与现有方法在短序列上会出现效率下降不同,FlashPrefill在4K上下文长度仍保持1.71倍加速,展示了其在不同序列规模下的鲁棒性和实际效用。
引用
@article{arxiv.2603.06199,
title = {FlashPrefill: Instantaneous Pattern Discovery and Thresholding for Ultra-Fast Long-Context Prefilling},
author = {Qihang Fan and Huaibo Huang and Zhiying Wu and Juqiu Wang and Bingning Wang and Ran He},
journal= {arXiv preprint arXiv:2603.06199},
year = {2026}
}