中文

大语言模型的假设分析:利用主动思维探索游戏世界

人工智能 2026-01-13 v3

摘要

大语言模型(LLMs)在MOBA游戏等高风险环境中难以进行决策,主要原因是缺乏主动推理能力以及对复杂游戏动态的理解有限。为解决此问题,我们提出了假设分析LLM(WiA-LLM)框架,该框架将LLM训练为一个显式的、基于语言的世界模型。WiA-LLM不使用潜在向量表示环境,而是使用自然语言模拟游戏状态如何随时间响应候选动作而演变,并为这些预测结果提供文本解释。WiA-LLM的训练分为两个阶段:在类人推理轨迹上进行监督微调,然后基于预测的未来状态与实际未来状态之间的一致性,使用基于结果的奖励进行强化学习。在《王者荣耀》(HoK)环境中,WiA-LLM在预测游戏状态变化方面达到了74.2%的准确率(相较于基础模型提升了27%)。此外,与纯粹的反应式LLM相比,WiA-LLM展示出与专家玩家更接近的战略行为,表明其具有更强的预见性和专家级决策能力。

关键词

引用

@article{arxiv.2509.04791,
  title  = {What-If Analysis of Large Language Models: Explore the Game World Using Proactive Thinking},
  author = {Yuan Sui and Yanming Zhang and Yi Liao and Yu Gu and Guohua Tang and Zhongqian Sun and Wei Yang and Bryan Hooi},
  journal= {arXiv preprint arXiv:2509.04791},
  year   = {2026}
}