中文

PANDO:基于在线技能蒸馏的高效多模态 AI 智能体

人工智能 2026-05-27 v2

摘要

近期多模态 web 智能体往往依赖增加推理时计算,包括 rollout 搜索、验证 pass、离线技能发现和专家模型堆栈。这引出一个核心问题:web 智能体是否可以随着经验积累而变得更高效,而非更昂贵?我们首先分析了来自 VisualWebArena 的轨迹,识别出三大低效来源:重复动作循环、隐藏发现成本和低 prompt-cache 重用。随后我们引入 PANDO,一个单次 rollout 在线技能蒸馏框架,维持结构化技能库,结合进度反思、基于置信度的技能降级、层次路由、视觉压缩和 cache-aware 提示。 在完整的 910 项 VisualWebArena 任务上,PANDO 达到了 58.3% 的成功率,超越 SGV(54.0%)和我们的 WALT 复现(45.2%),同时使用 SGV 的 58% 和 WALT 的 61% 的 token 数,无需任何预评估发现预算。进一步的 300 项消除实验表明,规则和例程提供了大部分成功收益,而路由、压缩和 cache-aware 提示将更大的技能库转化为更低的边际 token 成本。最后,我们引入了三个轨迹级别的效率指标——动作重复率、步骤开销比和提示缓存利用率——以便在终端成功之外使效率可见。

关键词

引用

@article{arxiv.2605.24785,
  title  = {PANDO: Efficient Multimodal AI Agents via Online Skill Distillation},
  author = {Yubo Li and Yidi Miao and Yuntian Shen and Yuxin Liu},
  journal= {arXiv preprint arXiv:2605.24785},
  year   = {2026}
}