中文

AutoEval: 一种用于移动智能体自主评估的实用框架

人工智能 2025-09-25 v2

摘要

移动智能体的全面评估可以显著推动其发展和实际应用。然而,由于在定义任务奖励信号和实现评估代码方面需要大量人工劳动,现有基准缺乏实用性和可扩展性。我们提出了 AutoEval,一个无需任何人工劳动即可测试移动智能体的评估框架。我们的方法设计了一种可用于自动生成任务奖励信号的 UI 状态变化表示,并采用 Judge System 进行自主评估。评估表明,AutoEval 可以自动生成与人工标注信号高度相关的奖励信号,并在自主评估中实现高精度(高达 94%),可与人工评估相媲美。最后,我们使用我们的框架评估了最先进的移动智能体,为其性能和局限性提供了见解。

关键词

引用

@article{arxiv.2503.02403,
  title  = {AutoEval: A Practical Framework for Autonomous Evaluation of Mobile Agents},
  author = {Jiahui Sun and Zhichao Hua and Yubin Xia},
  journal= {arXiv preprint arXiv:2503.02403},
  year   = {2025}
}