中文

4Hammer:面向长时间尺度的棋类强化学习环境

机器学习 2025-05-21 v1 计算与语言

摘要

大型语言模型在短时间尺度的任务中表现出色,但在需要更长时程的任务中则感到挑战。虽然已有覆盖扩展时长任务(如软件工程任务或视频游戏)的数据集,但目前缺乏专为强化学习和语言模型评估设计的复杂棋类实现。为填补这一空白,我们提出4Hammer强化学习环境,这是一个模拟Warhammer 40,000(一款复杂零和棋盘游戏)子集的数字孪生模拟器。Warhammer 40,000包含复杂规则,需人类玩家仔细阅读和理解超过50页的详细自然语言规则,把握其游戏棋子与对手棋子之间的相互作用,独立跟踪和传递不断演变的游戏状态。

关键词

引用

@article{arxiv.2505.13638,
  title  = {4Hammer: a board-game reinforcement learning environment for the hour long time frame},
  author = {Massimo Fioravanti and Giovanni Agosta},
  journal= {arXiv preprint arXiv:2505.13638},
  year   = {2025}
}