中文

Can Agent Conquer Web? Exploring the Frontiers of ChatGPT Atlas Agent in Web Games

计算与语言 2025-10-31 v1 人工智能

摘要

OpenAI 的 ChatGPT Atlas 引入了 web 交互的新能力,使模型能够在浏览器中分析网页、处理用户意图并直接执行光标和键盘输入。虽然其信息检索任务的能力已得到证明,但在动态、交互式环境中的表现尚未得到广泛探讨。本文以浏览器游戏为测试场景,对 Atlas 的 web 交互能力进行早期评估,包括 Google 的 T-Rex Runner、数独、Flappy Bird 和 Stein.world。我们采用游戏内得分作为量化指标,评估不同任务类型的表现。结果显示,Atlas 在逻辑推理类任务(如数独)中表现强劲,解谜速度显著超越人类基准;但在需要精确时机和运动控制的实时游戏中表现不佳,常常无法突破初始障碍。这些发现表明,Atlas 在分析性处理方面具有能力,但在需要实时交互的动态 web 环境中仍存在显著局限。项目网站可在 https://atlas-game-eval.github.io 访问。

关键词

引用

@article{arxiv.2510.26298,
  title  = {Can Agent Conquer Web? Exploring the Frontiers of ChatGPT Atlas Agent in Web Games},
  author = {Jingran Zhang and Ning Li and Justin Cui},
  journal= {arXiv preprint arXiv:2510.26298},
  year   = {2025}
}