ArborKV:面向树状 LLM 推理扩展的结构感知 KV 缓存管理
人工智能
2026-05-22 v1
摘要
LLM 推理的最新进展正从单次生成转向对中间推理状态进行显式搜索。树状思维(Tree-of-Thoughts, ToT)将推理组织为具有分支和回溯的树结构推理,但这会大幅放大 Key-Value(KV)缓存:为部分轨迹的前沿保留 KV 状态会迅速成为内存瓶颈,限制了吞吐量并在固定硬件预算下限制了搜索深度和宽度。我们通过观察到 ToT 式推理中的 KV 重用由搜索动力学决定:近期解码主要依赖于活跃分支及其祖先,而非活跃子树在短期内的重用概率较低,但仍需可恢复以支持回溯。基于此,我们提出了 ArborKV,一种结构感知驱逐框架,将轻量级值估算器与树感知分配策略耦合,执行纯 token 提取式驱逐,并通过惰性重新填充支持访问。针对 ToT 式推理基准进行的实验表明,ArborKV 在保持接近全保留准确率的同时,可实现约 4 倍的峰值 KV 内存降低,使固定设备预算下的更大搜索配置得以实现,否则会因内存不足而无法运行。
引用
@article{arxiv.2605.22106,
title = {ArborKV: Structure-Aware KV Cache Management for Scaling Tree-based LLM Reasoning},
author = {Yeqiu Chen and Ziyan Liu and Zhenxin Huang and Runquan Gui and Hong Wang and Lei Liu},
journal= {arXiv preprint arXiv:2605.22106},
year = {2026}
}