中文

用于《星际争霸II》策略优化的世界模型

人工智能 2026-02-17 v1

摘要

大型语言模型(LLMs)近期展现出强大的推理与泛化能力,这促使人们将其用作复杂环境中的决策策略。《星际争霸II》(SC2)因其庞大的状态-动作空间和部分可观测性,成为一个具有挑战性的测试平台。然而,现有的基于LLM的SC2智能体主要关注策略本身的改进,而忽略了将可学习的、动作条件化的转移模型集成到决策循环中。为弥补这一空白,我们提出了StarWM,这是首个用于SC2的世界模型,能够在部分可观测条件下预测未来观测。为便于学习SC2的混合动力学,我们引入了一种结构化的文本表示,将观测分解为五个语义模块,并构建了SC2-Dynamics-50k,这是首个用于SC2动力学预测的指令微调数据集。我们进一步开发了一个针对预测的结构化观测的多维离线评估框架。离线结果表明,StarWM相较于零样本基线取得了显著提升,包括资源预测准确率提升近60%,以及己方宏观态势一致性提升。最后,我们提出了StarWM-Agent,一个由世界模型增强的决策系统,它将StarWM集成到一个“生成-模拟-优化”的决策循环中,以实现基于前瞻的策略优化。针对SC2内置AI的在线评估显示,在困难(LV5)、更难(LV6)和极难(LV7)难度下,胜率分别提升了30%、15%和30%,同时宏观管理稳定性和战术风险评估能力也得到了改善。

关键词

引用

@article{arxiv.2602.14857,
  title  = {World Models for Policy Refinement in StarCraft II},
  author = {Yixin Zhang and Ziyi Wang and Yiming Rong and Haoxi Wang and Jinling Jiang and Shuang Xu and Haoran Wu and Shiyu Zhou and Bo Xu},
  journal= {arXiv preprint arXiv:2602.14857},
  year   = {2026}
}