中文

利用空闲时间的推测性规划提升 LLM 代理性能

人工智能 2026-05-22 v1

摘要

大型语言模型(LLM)基于代理通过利用多步推理和迭代工具调用以及环境交互来解决复杂任务,这会导致在等待观察时发生空闲时间。尽管空闲时间在大多数代理情景中很常见,但现有工作将其视为不可避免的开销或提出受限的解决方案,忽略了不同工具调用和未来观察不确定性之间的计算预算差异,从而导致空闲时间的次优利用。本文我们引入 IdleSpec,一种可扩展且通用的推理方法,可在空闲时间利用计算提高代理性能,同时最小化延迟开销。具体而言,IdleSpec 在空闲期间迭代生成计划候选人,并在观察结果可用时对其进行聚合,以指导下一步推理。为了在观察不确定性下有效地生成计划,IdleSpec 从通过后验反馈更新的学习分布中抽样,在补充性 drafting 策略之间进行抽样(即渐进式和恢复)。我们的实验表明,IdleSpec 在各种代理情景中有效地利用空闲时间显著提高了代理性能。特别地,在 GAIA 和 FRAMES 上,IdleSpec 采用 Gemini-2.5-Flash 实现了 55.6% 的平均准确率,超过了不使用空闲时间的 vanilla 基线的 5.1%。此外,对于涉及大量代码执行延迟的 MLE-Bench,IdleSpec 在 Any Medal rate 上实现了最高可达 9.1% 的性能提升,凸显了其对长期任务的通用性。

关键词

引用

@article{arxiv.2605.22154,
  title  = {IdleSpec: Exploiting Idle Time via Speculative Planning for LLM Agents},
  author = {Daewon Choi and Kyunghyun Park and Woomin Song and Saket Dingliwal and Sai Muralidhar Jayanthi and Jinwoo Shin and Aram Galstyan},
  journal= {arXiv preprint arXiv:2605.22154},
  year   = {2026}
}