中文

我们应该拳击多久?学习格斗游戏中的动作持续时间

人工智能 2026-05-21 v1 机器学习

摘要

诸如 Street Fighter II 等格斗游戏为强化学习 (RL) 智能体带来了独特的挑战,由于其快节奏的实时性质。在大多数 RL 框架中,智能体被硬编码为在固定间隔(通常是每帧或每 N 帧)做出决策。尽管这种设计确保了及时的响应,但限制了智能体调整其反应时间的能力。每帧行动可实现帧完美的反应,这在人类玩家而言是不现实的,而更长的固定间隔会降低计算成本但阻碍响应性。我们考虑另一种决策框架,其中智能体不仅学习采取什么动作,还学习执行它的时间长度。通过联合预测动作和持续时间,智能体可以在游戏中动态调整其响应性。我们使用开源的 FightLadder 环境实现该方法,智能体训练对抗脚本化内置机器人,系统性地测试不同的帧跳过配置以分析其对性能、响应性和所学行为的影响。实验表明,所学的时机可匹配优选固定帧跳过的性能,并鼓励可重复的动作模式,但单凭这一点并不确保鲁棒性。在大多数情况下,我们看到以持续较高的帧跳过值(即低响应性)表现最佳。这种策略更容易学习在同一动作反复重复的剥削策略,而脚本化机器人似乎对这种策略较为脆弱。

关键词

引用

@article{arxiv.2605.20911,
  title  = {For How Long Should We Be Punching? Learning Action Duration in Fighting Games},
  author = {Hoang Hai Nguyen and Kurt Driessens and Dennis J. N. J. Soemers},
  journal= {arXiv preprint arXiv:2605.20911},
  year   = {2026}
}

备注

Accepted at Computers and Games 2026