中文

赛车游戏中离线强化学习的基准环境

人工智能 2024-07-15 v1 机器学习

摘要

离线强化学习 (ORL) 通过消除对持续环境交互的需求来减少传统强化学习 (RL) 的高采样复杂度。ORL 利用预收集的转换数据集,从而将 RL 的应用范围扩展到那些过度的环境查询会增加训练时间并降低效率的任务中,例如现代大型 AAA 游戏。本文介绍 OfflineMania,一套新的 ORL 研究环境。它灵感来自著名的 TrackMania 系列,使用 Unity 3D 游戏引擎开发。该环境模拟单智能体赛车游戏,目标是通过最优路径完成赛道。我们提供了多套数据集以评估 ORL 性能。这些数据集由不同能力和规模的策略创建,旨在为算法开发和评估提供具有挑战性的测试平台。我们进一步在使用该环境的情况下,建立了一组针对各种在线 RL、ORL 和混合离线到在线 RL 方法的基线。

关键词

引用

@article{arxiv.2407.09415,
  title  = {A Benchmark Environment for Offline Reinforcement Learning in Racing Games},
  author = {Girolamo Macaluso and Alessandro Sestini and Andrew D. Bagdanov},
  journal= {arXiv preprint arXiv:2407.09415},
  year   = {2024}
}

备注

Accepted at IEEE Conference on Games