中文

面向游戏描述生成的语法与游戏玩法对齐强化学习

计算与语言 2025-06-30 v2 人工智能

摘要

游戏描述生成 (Game Description Generation, GDG) 是将自然语言文本转换为游戏描述语言 (Game Description Language, GDL) 中的游戏描述的任务。先前研究探索了利用大语言模型 (Large Language Model, LLM) 语境理解能力的生成方法,但准确复现游戏描述的游戏特征仍是挑战。本文提出了一种基于强化学习的 LLM 微调方法用于 GDG (RLGDG)。我们的训练方法通过引入语法奖励和概念奖励,同时提高语法正确性和对游戏概念的忠实度。此外,我们采用两阶段训练策略,在监督微调 (Supervised Fine-Tuning, SFT) 后应用强化学习 (Reinforcement Learning, RL)。实验结果表明,我们提出的方法显著优于仅使用 SFT 的基线方法。我们的代码可在 https://github.com/tsunehiko/rlgdg 获取。

关键词

引用

@article{arxiv.2503.15783,
  title  = {Grammar and Gameplay-aligned RL for Game Description Generation with LLMs},
  author = {Tsunehiko Tanaka and Edgar Simo-Serra},
  journal= {arXiv preprint arXiv:2503.15783},
  year   = {2025}
}

备注

Published at IEEE Conference on Games, 2025