SpecHop:加速多跳检索智能体的连续预测技术
计算与语言
2026-05-22 v1
摘要
大型语言模型越来越多地使用外部工具(如 web 搜索和文档检索)来解决信息密集型任务。然而,复杂任务中的多跳工具使用会引入显著延迟,因为模型必须在每次工具观察返回后才能继续执行。我们研究如何在不改变模型在无加速情况下所采用的最终轨迹的前提下加速此类轨迹,前提是可以使用更快但可靠性较低的 speculator 工具。我们构建了一个针对多跳工具使用场景的无损预测理论框架,刻画了可实现的最佳延迟收益。我们提出了 SpecHop,一个连续预测框架,维护多个预测线程,异步验证预测观察,当目标工具输出到达时提交正确的分支并回滚错误的分支。此过程在保持准确性的同时降低了墙钟延迟。我们表明,SpecHop 在拥有足够活跃线程的情况下可接近 oracle 延迟收益。实验上,在检索增强的多跳任务上,SpecHop 紧密匹配理论预测,在某些设置下可将延迟降低最高可达 40%。代码:https://github.com/mehrdadsaberi/spechop
引用
@article{arxiv.2605.21965,
title = {SpecHop: Continuous Speculation for Accelerating Multi-Hop Retrieval Agents},
author = {Mehrdad Saberi and Keivan Rezaei and Soheil Feizi},
journal= {arXiv preprint arXiv:2605.21965},
year = {2026}
}