SmartPlay:一个面向作为智能体的大语言模型的评测基准
机器学习
2024-03-19 v5 人工智能
摘要
近期的大语言模型(LLMs)已展现出作为智能体和下一代自动化的巨大潜力,但目前缺乏一个系统性的基准来评估 LLMs 作为智能体的能力。我们提出 SmartPlay:既是一个具有挑战性的基准,也是一种评估 LLMs 作为智能体的方法。SmartPlay 包含 6 种不同的游戏,包括石头剪刀布、汉诺塔、Minecraft。每款游戏具有独特的设定,提供多达 20 种评估设定和无限的环境变化。SmartPlay 中的每款游戏独特地挑战智能 LLM 智能体的 9 项重要能力中的一部分,包括对象依赖推理、提前规划、空间推理、从历史中学习以及理解随机性。各游戏所测试能力集合的区别使我们能够分别分析每一项能力。SmartPlay 不仅作为评估 LLM 智能体整体性能的严格试验场,也作为识别当前方法缺陷的路线图。我们在 github.com/Microsoft/SmartPlay 发布了基准。
引用
@article{arxiv.2310.01557,
title = {SmartPlay: A Benchmark for LLMs as Intelligent Agents},
author = {Yue Wu and Xuan Tang and Tom M. Mitchell and Yuanzhi Li},
journal= {arXiv preprint arXiv:2310.01557},
year = {2024}
}