RealWebAssist:面向长期 horizons web 辅助的基准测试
人工智能
2025-12-02 v2 计算与语言
计算机视觉与模式识别
机器学习
摘要
要实现对长期 horizons web 任务的成功辅助, AI代理必须能够在长时间内依从真实世界的用户指令。不同于现有 web 代理基准测试, 在真实世界中依从顺序指令面临诸多挑战, 超出执行单个明确定义任务的范围。例如, 真实世界的人类指令可能模糊不清、需要不同的AI辅助水平, 且随时间演变, 反映用户心理状态的变化。为填补这一差距, 我们引入RealWebAssist, 一个新型基准测试, 旨在评估在涉及长期 horizons 与 web 交互、视觉 GUI 定位以及理解模糊真实世界用户指令的情景下, 按顺序依从指令的能力。RealWebAssist包含来自真实世界用户的顺序指令数据集。每个用户指示 web 辅助器在多个网站上执行一系列任务. 成功的代理必须推理每个指令背后的真实意图, 跟踪用户的心理状态, 理解用户特定的例行程序, 并将预期任务定位到正确的 GUI 元素上的操作。我们的实验结果表明, 现代 SOTA 模型在理解和定位用户指令方面存在挑战, 这构成了在长期 horizons web 辅助中依从真实世界用户指令的关键挑战。
引用
@article{arxiv.2504.10445,
title = {RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users},
author = {Suyu Ye and Haojun Shi and Darren Shih and Hyokun Yun and Tanya Roosta and Tianmin Shu},
journal= {arXiv preprint arXiv:2504.10445},
year = {2025}
}
备注
Project Website: https://scai.cs.jhu.edu/projects/RealWebAssist/ Code: https://github.com/SCAI-JHU/RealWebAssist