面向延迟优化的智能体即时编译
机器学习
2026-05-21 v1 人工智能
摘要
计算机使用智能体(CUA)通过生成对浏览器上的点击、输入、滚动等工具调用序列来自动化由自然语言指定的任务,如“订购塔科贝最便宜的物品”。当前实现采用顺序获取-截图-执行循环,每次迭代均需调用 LLM,导致高延迟且因工具使用错误频发。我们提出智能体即时编译(agent JIT compilation)技术,即将任务描述直接编译为可执行代码,代码中可包含 LLM 调用、工具调用及并行操作。该方法由三部分组成:(1)JIT-Planner 生成多种代码计划,验证其符合工具规范后选择最小成本方案;(2)JIT-Scheduler 通过基于学习延迟分布的蒙特卡洛成本估计探索并行策略;(3)一种不变量约束工具协议,规定前置条件和后置条件状态要求,从而降低生成错误工具使用计划的概率。在 5 个网页应用中,JIT-Planner 相较于 Browser-Use 实现 的加速和 的准确率提升,JIT-Scheduler 相较于 OpenAI CUA 实现 的加速和 的准确率提升。
引用
@article{arxiv.2605.21470,
title = {Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling},
author = {Caleb Winston and Ron Yifeng Wang and Azalia Mirhoseini and Christos Kozyrakis},
journal= {arXiv preprint arXiv:2605.21470},
year = {2026}
}
备注
Accepted at ICML 2026