将游戏代码世界模型生成蒸馏到轻量级大语言模型中
人工智能
2026-05-26 v1
摘要
大型语言模型(LLM)在从自然语言生成可执行代码方面展现出巨大潜力,为自动构建AI代理的环境提供了可能。最近的工作表明,LLM能够将游戏规则翻译为与蒙特卡洦树搜索等求解器兼容的Python实现。我们聚焦于游戏场景,其中生成的环境必须实现规则、合法动作、状态转移、观察和奖励。我们将这些游戏特定的可执行模型称为游戏代码世界模型(GameCWM)。然而,当前生成代码世界模型的方法依赖前沿模型和推理时的细化循环,限制了可及性和可扩展性。本文研究通过后训练将GameCWM生成能力蒸馏到较小模型中的可能性。我们引入:(1)覆盖完美信息和不完全信息游戏的30款游戏的精选数据集,(2)评估生成代码在结构和语义游戏属性方面的验证框架,(3)结合监督微调(SFT)与可验证奖励强化学习(RLVR)的后训练管道。我们实验了Qwen2.5-3B-Instruct,发现SFT可提高语法正确性,而RLVR可提高执行层面的规则遵循性,从而提升模型在完美信息和不完全信息游戏中生成有效GameCWM的能力。总体而言,我们的管道使Qwen2.5-3B-Instruct在生成有效GameCWM方面更具能力,为从自然语言自动生成环境提供了可扩展的路径。
引用
@article{arxiv.2605.24375,
title = {Distilling Game Code World Model Generation into Lightweight Large Language Models},
author = {Tyrone Serapio and Arjun Prakash and Haoyang Xu and Kevin Wang and Amy Greenwald},
journal= {arXiv preprint arXiv:2605.24375},
year = {2026}
}