4Hammer:面向长时间尺度的棋类强化学习环境
机器学习
2025-05-21 v1 计算与语言
摘要
大型语言模型在短时间尺度的任务中表现出色,但在需要更长时程的任务中则感到挑战。虽然已有覆盖扩展时长任务(如软件工程任务或视频游戏)的数据集,但目前缺乏专为强化学习和语言模型评估设计的复杂棋类实现。为填补这一空白,我们提出4Hammer强化学习环境,这是一个模拟Warhammer 40,000(一款复杂零和棋盘游戏)子集的数字孪生模拟器。Warhammer 40,000包含复杂规则,需人类玩家仔细阅读和理解超过50页的详细自然语言规则,把握其游戏棋子与对手棋子之间的相互作用,独立跟踪和传递不断演变的游戏状态。
引用
@article{arxiv.2505.13638,
title = {4Hammer: a board-game reinforcement learning environment for the hour long time frame},
author = {Massimo Fioravanti and Giovanni Agosta},
journal= {arXiv preprint arXiv:2505.13638},
year = {2025}
}