中文

ProSoftArena:专业软件环境中多模态智能体层次化能力的基准测试

软件工程 2026-01-07 v1 人工智能

摘要

多模态智能体在通用计算机任务上取得了快速进展,但现有基准测试主要局限于浏览器和基础桌面应用程序,未能涵盖主导现实世界科学和工业实践的专业软件工作流程。为弥合这一差距,我们引入了 ProSoftArena,这是一个专用于评估专业软件环境中多模态智能体能力的基准测试和平台。我们构建了首个针对智能体使用专业软件的能力层次化模型,并构建了一个涵盖 6 个学科、13 个核心专业应用程序的 436 个真实工作与研究任务的基准测试。为确保可靠且可重复的评估,我们构建了一个可执行的真实计算机环境,构建了基于执行的评估框架,并独特地融入了人类在环评估范式。大量实验表明,即使是表现最好的智能体,在 L2 任务上也仅取得 24.4% 的成功率,在 L3 多软件工作流程中完全失败。深入分析进一步为解决当前智能体局限性和更有效的设计原则提供了宝贵的见解,为构建更具能力的专业软件环境中的智能体指明了方向。该项目可在 https://prosoftarena.github.io 访问。

关键词

引用

@article{arxiv.2601.02399,
  title  = {ProSoftArena: Benchmarking Hierarchical Capabilities of Multimodal Agents in Professional Software Environments},
  author = {Jiaxin Ai and Yukang Feng and Fanrui Zhang and Jianwen Sun and Zizhen Li and Chuanhao Li and Yifan Chang and Wenxiao Wu and Ruoxi Wang and Mingliang Zhai and Kaipeng Zhang},
  journal= {arXiv preprint arXiv:2601.02399},
  year   = {2026}
}