中文

慢-快推理:基于句内支持稳定性的无训练推理加速

机器学习 2026-03-13 v1 人工智能

摘要

长上下文自回归解码仍然昂贵,因为每一步解码都必须重复处理不断增长的历史。我们观察到在解码过程中存在一种一致模式:在一个句子内部,以及更广泛地在一个短暂的语义连贯范围内,主导注意力支持往往基本保持稳定。基于这一观察,我们提出了慢-快推理(Slow-Fast Inference, SFI),这是一种无需训练的解码框架,将生成分解为频繁的低成本快速步骤和偶尔的密集注意力慢速步骤。快速步骤通过重用紧凑的稀疏记忆来实现高效解码。慢速步骤在语义边界附近触发。在慢速步骤中,模型会重新检查更广阔的上下文,并使用选择器刷新所选记忆,以供后续快速步骤使用。在评估的上下文长度上,SFI实现了约1.6×1.6\times--14.4×14.4\times的解码吞吐量提升,同时在质量上通常与全KV基线相当,适用于长上下文和长程CoT设置。由于SFI无需训练且可直接应用于现有检查点,它为在长上下文、长程和智能体工作负载中降低自回归推理模型的推理成本提供了实用的路径。

关键词

引用

@article{arxiv.2603.12038,
  title  = {Slow-Fast Inference: Training-Free Inference Acceleration via Within-Sentence Support Stability},
  author = {Xingyu Xie and Zhaochen Yu and Yue Liao and Tao Wang and Kim-Chuan Toh and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2603.12038},
  year   = {2026}
}