SC2Arena 与 StarEvolve:面向复杂决策任务中大型语言模型的基准测试与自我改进框架
机器学习
2025-08-15 v1
摘要
评估大型语言模型(LLMs)在复杂决策中的能力,对于提升 AI 的战略规划和实时适应能力至关重要。然而,现有的用于《星际争霸 II》等任务的基准测试未能捕捉到游戏的完整复杂性,例如其完整的游戏上下文、多样化的动作空间和所有可玩种族。为了解决这一差距,我们提出了 SC2Arena,这是一个完全支持所有可玩种族、低级动作空间,并优化基于文本的观察以解决空间推理挑战的基准测试。作为补充,我们引入了 StarEvolve,这是一个将战略规划与战术执行相结合的分层框架,具有迭代自我修正和通过对高质量游戏数据进行微调实现持续改进的特点。其关键组件包括用于分解游戏过程的规划器-执行器-验证器结构,以及用于选择高质量训练样本的评分系统。使用 SC2Arena 进行的全面分析为开发通用智能体提供了宝贵的见解,这在以前的基准测试中是不可能实现的。实验结果还表明,我们提出的 StarEvolve 在战略规划方面取得了卓越的性能。我们的代码、环境和算法均已公开可用。
引用
@article{arxiv.2508.10428,
title = {SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks},
author = {Pengbo Shen and Yaqing Wang and Ni Mu and Yao Luan and Runpeng Xie and Senhao Yang and Lexiang Wang and Hao Hu and Shuang Xu and Yiqin Yang and Bo Xu},
journal= {arXiv preprint arXiv:2508.10428},
year = {2025}
}