中文

计算机使用智能体综合调查:基础、挑战与未来方向

人工智能 2026-04-09 v3 人机交互 系统与控制 系统与控制

摘要

计算机使用智能体 (ACU) 是一种新兴类系统,能够通过自然语言指令在数字设备(如桌面、移动电话和网页平台)上执行复杂任务。这些智能体可以通过低级动作(如鼠标点击和触摸屏手势)控制软件来自动化任务。尽管取得了快速进展,但 ACU 尚未成熟可用于日常使用。本综述调查了 ACU 的最新进展、趋势和研究空白,旨在推动实用 ACU 开发。我们提供了 ACU 领域的全面综述,引入一种贯穿三个维度的统一分类框架:(I) 域视角,刻画智能体运行的情境;(II) 交互视角,描述观察模态(如屏幕截图、HTML)和行动模态(如鼠标、键盘、代码执行);(III) 智能体视角,详述智能体如何感知、推理和学习。通过该分类框架,我们综述了 87 个 ACU 和 33 个数据集,涵盖基于 foundation model 的方法和经典方法。我们的分析识别出六个主要研究空白:泛化能力不足、学习效率低、规划有限、基准测试的任务复杂度不够、评估不标准化以及研究与实际部署条件之间存在脱节。为解决这些空白,我们主张:(a) 采用基于视觉的观察和低级控制以增强泛化能力;(b) 超越静态提示的自适应学习;(c) 有效的规划与推理方法和模型;(d) 反映真实世界任务复杂度的基准测试;(e) 基于任务成功率的标准化评估;(f) 将智能体设计与实际部署约束对齐。我们整合的分类框架和分析为 ACU 研究向通用、稳健且可扩展的计算机使用智能体迈进奠定了基础。

关键词

引用

@article{arxiv.2501.16150,
  title  = {A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions},
  author = {Pascal J. Sager and Benjamin Meyer and Peng Yan and Rebekka von Wartburg-Kottler and Layan Etaiwi and Aref Enayati and Gabriel Nobel and Ahmed Abdulkadir and Benjamin F. Grewe and Thilo Stadelmann},
  journal= {arXiv preprint arXiv:2501.16150},
  year   = {2026}
}