中文

RealWebAssist:面向长期 horizons web 辅助的基准测试

人工智能 2025-12-02 v2 计算与语言 计算机视觉与模式识别 机器学习

摘要

要实现对长期 horizons web 任务的成功辅助, AI代理必须能够在长时间内依从真实世界的用户指令。不同于现有 web 代理基准测试, 在真实世界中依从顺序指令面临诸多挑战, 超出执行单个明确定义任务的范围。例如, 真实世界的人类指令可能模糊不清、需要不同的AI辅助水平, 且随时间演变, 反映用户心理状态的变化。为填补这一差距, 我们引入RealWebAssist, 一个新型基准测试, 旨在评估在涉及长期 horizons 与 web 交互、视觉 GUI 定位以及理解模糊真实世界用户指令的情景下, 按顺序依从指令的能力。RealWebAssist包含来自真实世界用户的顺序指令数据集。每个用户指示 web 辅助器在多个网站上执行一系列任务. 成功的代理必须推理每个指令背后的真实意图, 跟踪用户的心理状态, 理解用户特定的例行程序, 并将预期任务定位到正确的 GUI 元素上的操作。我们的实验结果表明, 现代 SOTA 模型在理解和定位用户指令方面存在挑战, 这构成了在长期 horizons web 辅助中依从真实世界用户指令的关键挑战。

关键词

引用

@article{arxiv.2504.10445,
  title  = {RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users},
  author = {Suyu Ye and Haojun Shi and Darren Shih and Hyokun Yun and Tanya Roosta and Tianmin Shu},
  journal= {arXiv preprint arXiv:2504.10445},
  year   = {2025}
}

备注

Project Website: https://scai.cs.jhu.edu/projects/RealWebAssist/ Code: https://github.com/SCAI-JHU/RealWebAssist