最佳-Q:通过推理中的Q函数动作排序提升视觉语言模型代理
人工智能
2026-02-02 v1
摘要
视觉语言模型(VLM)已成为在网页和操作系统等数字环境中实现自主运作的强大代理 backbone。然而,这些模型对快速变化的环境(如网页)适应性较差,这可以通过需要大规模模型训练和数据收集的微调来缓解。本文引入一种新范式,在无需策略重新训练的情况下提升具有代理性的 VLM 策略。根本上,我们的方法将 VLM 作为高容量动作提议者的角色与最终动作选择机制分离。我们保持 VLM 策略冻结,并使用其为给定状态生成一组候选动作。随后,一个轻量级、离线训练的 Q 函数对这些候选动作进行排序,代理执行估计价值最高的动作。我们的主要贡献在于在推理阶段直接应用 Q 函数实现即时策略改进,而不是离线用于策略重新训练的数据标注。我们在学术 WebVoyager 基准测试上展示了该方法显著提升了代理成功率,将 Qwen2.5-VL-7B 代理从 38.8% 提升至 55.7%,将专有 GPT-4.1 代理从 82.4% 提升至 88.8%。
引用
@article{arxiv.2601.22701,
title = {Best-of-Q: Improving VLM agents with Q-function Action Ranking at Inference},
author = {Emilien Biré and María Santos and Kai Yuan},
journal= {arXiv preprint arXiv:2601.22701},
year = {2026}
}