中文

MMAU:跨领域智能体能力的全面基准

人工智能 2024-08-19 v3

摘要

近期大语言模型(LLM)的进展增加了对全面基准进行人类式智能体能力评估的需求。现有基准虽有参考价值,但常聚焦特定应用场景,强调任务完成,却未厘清驱动这些结果的底层技能。缺乏粒度使得难以深入判断失败根源。此外,环境部署需付出大量劳动,尤其在交互式任务中常出现不可靠与不可复现的问题。为克服这些限制,我们引入 Massive Multitask Agent Understanding(MMAU)基准, featuring 全面离线任务,无需复杂环境部署。其覆盖 Tool-use、Directed Acyclic Graph(DAG) QA、Data Science 与机器学习编码、Contest 级别编程与数学等五大领域,并涵盖 Understanding、Reasoning、Planning、Problem-solving 与 Self-correction 五种核心能力。MMAU 包含 20 个精心设计的任务,涉及超过 3000 条独立 prompt,为评估 LLM 智能体的优势与局限提供了全面框架。我们在 MMAU 上测试了 18 个代表性模型,提供深入且富有洞察力的分析。最终,MMAU 不仅阐明了 LLM 智能体的能力与局限,也提升了其性能可解释性。MMAU 的数据集与评估脚本已发布于 https://github.com/apple/axlearn/tree/main/docs/research/mmau。

关键词

引用

@article{arxiv.2407.18961,
  title  = {MMAU: A Holistic Benchmark of Agent Capabilities Across Diverse Domains},
  author = {Guoli Yin and Haoping Bai and Shuang Ma and Feng Nan and Yanchao Sun and Zhaoyang Xu and Shen Ma and Jiarui Lu and Xiang Kong and Aonan Zhang and Dian Ang Yap and Yizhe zhang and Karsten Ahnert and Vik Kamath and Mathias Berglund and Dominic Walsh and Tobias Gindele and Juergen Wiest and Zhengfeng Lai and Xiaoming Wang and Jiulong Shan and Meng Cao and Ruoming Pang and Zirui Wang},
  journal= {arXiv preprint arXiv:2407.18961},
  year   = {2024}
}