用于优化缓存和注意力局部性的跨度查询
人工智能
2025-11-05 v1
摘要
客户端正在发展超越聊天完成,现在包括各种创新的推理时间扩展和深度推理技术。同时,推理服务器仍严重优化用于聊天完成。先前的工作表明,如果推理服务器针对这些非聊天用例进行优化,KV 缓存命中率可获得显著提升。然而,这些方案也针对单一用例(RAG)进行优化。在本文中,我们提出一种跨度查询(span query)来泛化推理服务器的接口。我们展示了聊天、RAG、推理时间扩展和代理工作负载都可表示为跨度查询。我们说明,此前工作所假设的关键区别在于输入顺序是否重要——即它们是否可交换。在聊天中,它们不可交换。在 RAG 中,它们通常可交换。本文提出跨度查询,这是一组推理调用的表达式树,通过可交换性约束进行链接。我们描述跨度查询的语法和语义。我们展示如何自动优化以提高 KV 缓存局部性。我们说明,对 vLLM(仅影响 492 行代码)的小修改即可实现跨度查询的高性能执行。使用该堆栈,我们展示跨度查询可实现两种非聊天用例的 TTFT 降低 10-20 倍。最后,我们展示跨度查询还可用于优化注意力局部性,以避免所谓的“middle-lost”问题。我们演示,在 2B 参数模型上,使用注意力优化的跨度查询在准确率上远超使用 8B 参数模型的股票推理服务器。
引用
@article{arxiv.2511.02749,
title = {Using Span Queries to Optimize for Cache and Attention Locality},
author = {Paul Castro and Nick Mitchell and Nathan Ordonez and Thomas Parnell and Mudhakar Srivatsa and Antoni Viros i Martin},
journal= {arXiv preprint arXiv:2511.02749},
year = {2025}
}
备注
12 pages, 17 figures