AsyncSpade:基于异步稀疏解码的高效测试时扩展方法
摘要
测试时扩展(Test-time scaling,TTS)通过长链式思维(chain-of-thought,CoT)提升大语言模型(LLM)的推理能力,但线性增长的 KV 缓存放大了 LLM 解码的内存受限瓶颈。查询感知的页级稀疏解码可在受限的 FLOPs 预算下实现最先进的性能,但受限于序列依赖的页面过滤和粗粒度的 token 选择,限制了面向高并发和长 CoT 场景下的服务效率和模型性能(甚至会消耗超过前向管线本身的运行时间)。本文首先发现,当前步骤的查询状态可从最近一段查询窗口中准确地统一近似,从而实现无需等待解码循环即可完成查询感知稀疏化。我们提出 AsyncSpade,一个用于高效 TTS 的异步框架,其包含两个核心组件:(1)一种新型轻量级时序回归模块,用于预测下一个 token 的查询状态;(2)一种异步且解耦的框架,将 KV 缓存过滤从自回归解码循环中解耦,通过异步方式将 token 级别的 KV 选择与前向推理计算重叠。据我们了解,AsyncSpade 是首个在不牺牲模型性能的情况下消除序列依赖性的方案。我们在常规 LLM 服务配置下进行了验证,使用 A100 节点,AsyncSpade 完全将 KV 缓存操作与推理管线重叠,实现了理论上最优的时间-输出-token(time-per-output-token,TPOT)。具体而言,AsyncSpade 比最先进基线(即 Quest)实现了超过 20% 的 TPOT 降低,相较于 Qwen3-8B 和 Qwen3-32B 模型上的完整注意力机制实现了至少 50% 的 TPOT 降低,同时在 various TTS 基准测试(AIME-24/25、GPQA-Diamond、MATH-500)中保持或超越其准确率。
引用
@article{arxiv.2510.07486,
title = {AsyncSpade: Efficient Test-Time Scaling with Asynchronous Sparse Decoding},
author = {Shuqing Luo and Yilin Guan and Pingzhi Li and Hanrui Wang and Tianlong Chen},
journal= {arXiv preprint arXiv:2510.07486},
year = {2025}
}
备注
14 pages, 17 figures