中文

面向延迟优化的智能体即时编译

机器学习 2026-05-21 v1 人工智能

摘要

计算机使用智能体(CUA)通过生成对浏览器上的点击、输入、滚动等工具调用序列来自动化由自然语言指定的任务,如“订购塔科贝最便宜的物品”。当前实现采用顺序获取-截图-执行循环,每次迭代均需调用 LLM,导致高延迟且因工具使用错误频发。我们提出智能体即时编译(agent JIT compilation)技术,即将任务描述直接编译为可执行代码,代码中可包含 LLM 调用、工具调用及并行操作。该方法由三部分组成:(1)JIT-Planner 生成多种代码计划,验证其符合工具规范后选择最小成本方案;(2)JIT-Scheduler 通过基于学习延迟分布的蒙特卡洛成本估计探索并行策略;(3)一种不变量约束工具协议,规定前置条件和后置条件状态要求,从而降低生成错误工具使用计划的概率。在 5 个网页应用中,JIT-Planner 相较于 Browser-Use 实现 10.4×10.4\times 的加速和 +28%+28\% 的准确率提升,JIT-Scheduler 相较于 OpenAI CUA 实现 2.4×2.4\times 的加速和 +9%+9\% 的准确率提升。

关键词

引用

@article{arxiv.2605.21470,
  title  = {Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling},
  author = {Caleb Winston and Ron Yifeng Wang and Azalia Mirhoseini and Christos Kozyrakis},
  journal= {arXiv preprint arXiv:2605.21470},
  year   = {2026}
}

备注

Accepted at ICML 2026