中文

Emergence WebVoyager:面向野外(Web)智能体的一致性与透明性评估

人工智能 2026-04-01 v1

摘要

对在复杂真实环境中运行的AI智能体进行可靠评估,需要方法论具备鲁棒性、透明性,并与智能体预期执行的任务在语境上保持一致。本研究识别了现有AI智能体评估实践中的持续不足,这些不足在网页智能体评估中尤为突出,如我们对WebVoyager的审计所表明的,包括任务框架模糊性和操作变异性,这些因素妨碍了有意义的、可复现的性能比较。为应对这些挑战,我们提出了Emergence WebVoyager,即WebVoyager基准的增强版本,通过明确的任务实例化、失败处理、标注和报告指南来标准化评估方法。Emergence WebVoyager实现了95.9%的标注者间一致性,表明任务构建和评估的清晰性和可靠性得到了提升。将该框架应用于评估OpenAI Operator揭示了跨领域和任务类型的显著性能差异,总体成功率为68.6%,远低于OpenAI此前报告的87%,证明了我们的方法对于更严格、可比较的网页智能体评估的效用。

关键词

引用

@article{arxiv.2603.29020,
  title  = {Emergence WebVoyager: Toward Consistent and Transparent Evaluation of (Web) Agents in The Wild},
  author = {Deepak Akkil and Mowafak Allaham and Amal Raj and Tamer Abuelsaad and Ravi Kokku},
  journal= {arXiv preprint arXiv:2603.29020},
  year   = {2026}
}