GAIA:通用人工智能助手基准
计算与语言
2023-11-23 v1 人工智能
摘要
我们提出GAIA,一个面向通用人工智能助手(General AI Assistants)的基准,若能被解决,将代表AI研究的一座里程碑。GAIA提出需要一系列基本能力(如推理、多模态处理、网页浏览以及通用的工具使用熟练度)的真实世界问题。GAIA问题对人类而言概念简单,对大多数先进AI却具挑战性:我们显示人类受访者正确率为92%,而配备插件(plugins)的GPT-4仅为15%。这一显著的性能差距,与近期LLMs在需法律或化学等专业技能任务上超越人类的趋势形成对比。GAIA的理念有别于当前AI基准倾向于瞄准对人类愈发困难的任务之趋势。我们主张,通用人工智能(AGI)的出现取决于系统能否在此类问题上展现出与普通人相仿的鲁棒性。基于GAIA方法,我们设计了466个问题及其答案。我们发布问题,同时保留其中300个的答案以支撑排行榜,详见 https://huggingface.co/gaia-benchmark。
引用
@article{arxiv.2311.12983,
title = {GAIA: a benchmark for General AI Assistants},
author = {Grégoire Mialon and Clémentine Fourrier and Craig Swift and Thomas Wolf and Yann LeCun and Thomas Scialom},
journal= {arXiv preprint arXiv:2311.12983},
year = {2023}
}