中文

Open CaptchaWorld:一个用于测试与基准评估多模态 LLM 智能体的综合 Web 平台

人工智能 2025-06-02 v1 计算与语言 计算机视觉与模式识别 机器学习

摘要

CAPTCHA 一直是将 Web 智能体部署于实际应用中的关键瓶颈,常阻碍其完成端到端自动化任务。尽管现代多模态 LLM 智能体在静态感知任务中表现出色,但它们处理诸如 CAPTCHA 这类交互式、多步推理挑战的能力在很大程度上尚未得到检验。为填补这一空白,我们推出了 Open CaptchaWorld,这是首个专门设计的基于 Web 的基准测试与平台,旨在通过多样且动态的 CAPTCHA 谜题评估由 MLLM 驱动的智能体的视觉推理与交互能力。我们的基准涵盖 20 种现代 CAPTCHA 类型,共计 225 个 CAPTCHA,并使用我们提出的一项新指标进行标注:CAPTCHA 推理深度,该指标量化了解决每个谜题所需的认知与操作步骤数。实验结果表明,人类始终能获得接近满分的成绩,而最先进的 MLLM 智能体则面临显著困难,其中 Browser-Use Openai-o3 的成功率最高仅为 40.0%,远低于人类水平的 93.3%。这凸显了 Open CaptchaWorld 作为关键基准的价值,可用于诊断当前多模态智能体的局限性并指导开发更鲁棒的多模态推理系统。代码和数据可在该 https URL 获取。

关键词

引用

@article{arxiv.2505.24878,
  title  = {Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents},
  author = {Yaxin Luo and Zhaoyi Li and Jiacheng Liu and Jiacheng Cui and Xiaohan Zhao and Zhiqiang Shen},
  journal= {arXiv preprint arXiv:2505.24878},
  year   = {2025}
}

备注

Code at: https://github.com/MetaAgentX/OpenCaptchaWorld