构建计算机使用智能体验证器的艺术
密码学与安全
2026-04-09 v1 人工智能
多智能体系统
摘要
验证计算机使用智能体(CUA)轨迹的成功是一个关键挑战:没有可靠的验证,评估和训练信号都无法被信任。在本文中,我们分享了构建针对网页任务的最佳验证器——通用验证器(Universal Verifier)的经验教训。我们围绕四个关键原则设计通用验证器:1)构建具有有意义且不重叠标准的评分细则以降低噪声;2)分离过程奖励和结果奖励以产生互补信号,捕捉智能体遵循正确步骤但被阻塞或通过意外路径成功的情况;3)区分可控和不可控的失败,通过级联无错策略进行评分,以实现更细粒度的失败理解;4)采用分治上下文管理方案,关注轨迹中的所有截图,提高在更长任务范围内的可靠性。我们在 CUAVerifierBench 上验证了这些发现,这是一个包含过程和结果人工标注的新 CUA 轨迹数据集,表明我们的通用验证器与人工标注的一致性程度与人工标注之间的一致性程度相当。与 WebVoyager(≥45%)和 WebJudge(≥22%)等基线相比,我们报告了假阳性率降至接近零。我们强调这些收益源于上述设计选择的累积效应。我们还发现自动研究智能体在 5% 的时间内达到专家质量的 70%,但未能发现复制通用验证器所需的所有策略。我们开源了通用验证器系统和 CUAVerifierBench;地址为 https://github.com/microsoft/fara。
引用
@article{arxiv.2604.06240,
title = {The Art of Building Verifiers for Computer Use Agents},
author = {Corby Rosset and Pratyusha Sharma and Andrew Zhao and Miguel Gonzalez-Fernandez and Ahmed Awadallah},
journal= {arXiv preprint arXiv:2604.06240},
year = {2026}
}