面向计算机操作代理的自适应视觉语言模型路由
计算与语言
2026-03-16 v1 计算机视觉与模式识别
摘要
计算机操作代理(Computer Use Agents, CUAs)通过依赖视觉语言模型(Vision-Language Model, VLM)来解释屏幕截图并预测依据工具调用,将自然语言指令转化为点击、键盘输入和滚动等 GUI 操作。然而, grounding 准确率在不同 VLM 之间差异巨大,而当前的 CUA 系统通常会将每一次操作路由到单个固定的模型,无论其难易程度。我们提出了 \textbf{自适应 VLM 路由}(Adaptive VLM Routing, AVR),一个在 CUA 编排器与 VLM 资源池之间插入轻量级语义路由层的框架。对于每一次工具调用,AVR 从多模态嵌入中估计操作难度,探测小型 VLM 以衡量置信度,并将操作路由到满足目标可靠性阈值的性价比最高的模型。对于具有记忆 prior UI 交互的 \textit{warm} 代理,通过检索的上下文进一步缩小小型和大型模型之间的能力差距,使许多操作无需升级即可完成。我们将路由建模为成本-精度权衡,推导出基于阈值的模型选择策略,并使用 ScreenSpot-Pro grounding 数据和 OpenClaw 代理路由基准进行评估。在这些设置下,AVR 可实现最高达 78% 的推理成本降低,同时仅比全大型模型基准线低于 2 个百分点。结合 Visual Confused Deputy 警卫措施后,AVR 还能直接将高风险操作路由到最强可用模型,在效率和安全性方面实现统一。材料包括模型、基准和代码:https://github.com/vllm-project/semantic-router。
引用
@article{arxiv.2603.12823,
title = {Adaptive Vision-Language Model Routing for Computer Use Agents},
author = {Xunzhuo Liu and Bowei He and Xue Liu and Andy Luo and Haichen Zhang and Huamin Chen},
journal= {arXiv preprint arXiv:2603.12823},
year = {2026}
}