大语言模型玩《星际争霸II》:基准测试与摘要链方法
人工智能
2024-06-19 v3
摘要
由于需要精确的微操和宏观的战略意识,《星际争霸II》是AI智能体的一个极具挑战性的基准。先前的工作,如Alphastar和SCC,在应对《星际争霸II》方面取得了令人瞩目的表现,但在长期战略规划和策略可解释性方面仍存在不足。新兴的大语言模型(LLM)智能体,如Voyage和MetaGPT,在解决复杂任务方面展现出巨大潜力。受此启发,我们旨在验证LLM在《星际争霸II》这一高度复杂的RTS游戏上的能力。为了便于充分利用LLM的推理能力,我们首先开发了一个文本化的《星际争霸II》环境,称为TextStarCraft II,供LLM智能体进行交互。其次,我们提出了一种摘要链方法,包括用于处理原始观察的单帧摘要,以及用于分析游戏信息、提供指令建议和生成战略决策的多帧摘要。我们的实验包含两部分:第一,由人类专家进行评估,包括评估LLM对《星际争霸II》知识的掌握程度以及LLM智能体在游戏中的表现;第二,LLM智能体在游戏中的表现,涵盖胜率及摘要链的影响。实验结果表明:1. LLM具备应对《星际争霸II》场景所需的相关知识和复杂规划能力;2. 人类专家认为LLM智能体的表现接近于有八年《星际争霸II》游戏经验的普通玩家;3. LLM智能体能够在Harder(Lv5)难度级别下击败内置AI。我们已开源代码并发布了LLM智能体玩《星际争霸II》的演示视频。
引用
@article{arxiv.2312.11865,
title = {Large Language Models Play StarCraft II: Benchmarks and A Chain of Summarization Approach},
author = {Weiyu Ma and Qirui Mi and Yongcheng Zeng and Xue Yan and Yuqiao Wu and Runji Lin and Haifeng Zhang and Jun Wang},
journal= {arXiv preprint arXiv:2312.11865},
year = {2024}
}