中文

SinkRouter:面向长上下文解码的 Sink-Aware 路由策略

机器学习 2026-04-21 v1 人工智能

摘要

在 LLM 和 LMM 的长上下文解码中,注意力机制因必须从 GPU 内存中加载大量 KV-cache 数据而变得越来越内存受限。现有的加速策略往往以牺牲准确性为代价,通过依赖可能丢弃有用信息的启发式剪枝来实现。从更深层次看,这些方法也倾向于无差别地保留所有高得分 token,将早期 token 视为必不可少的锚点,或依赖启发式头路由,反映出对注意力 sink 现象的机制性理解不足。本文我们发现,注意力 sink 现象对应于一种在训练期间构建的稳定、可到达且可控制的固定点。基于此洞察,我们提出了 SinkRouter,即一种训练无关的选择性路由框架,用于检测 sink 信号并跳过本会产生近零输出的计算。为将此机制转化为实际加速,我们开发了具备块级分支和 Split-K 并行性的硬件感知 Triton kernel。我们在包括 LongBench、InfiniteBench、CVBench、MileBench 和 MMVP 在内的多套长上下文基准测试上进行了广泛评估,采用文本模型和多模态模型 Backbone 如 Llama-3.1-8B、Llama-3.1-70B、Yi-9B-200K、LLaVA-1.5-7B 和 LLaVA-1.5-13B。在所有这些设置下,SinkRouter 均能在保持竞争准确性的同时持续提高解码效率,达到 2.03 倍的加速,上下文长度为 512K。

关键词

引用

@article{arxiv.2604.16883,
  title  = {SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models},
  author = {Junnan Liu and Xinyan Liu and Peifeng Gao and Zhaobo Qi and Beichen Zhang and Weigang Zhang and Antoni Bert Chen},
  journal= {arXiv preprint arXiv:2604.16883},
  year   = {2026}
}