中文

NeoRL-2:面向离线强化学习的近实世界基准与扩展现实情景

机器学习 2025-03-26 v1 人工智能

摘要

离线强化学习旨在无需(昂贵的)环境访问的情况下从历史数据中学习。为促进离线 RL 研究,此前我们引入了 NeoRL,指出来自真实世界任务的数据集往往保守且受限。凭借多年将离线 RL 应用于 various 领域的经验,我们识别出additional 真实世界挑战,包括部署控制系统产生的极度保守数据分布、由高延迟转换导致的动作延迟效应、来自转换不可控方差的external factors,以及难以在决策过程中评估的global safety constraints。这些挑战在先前的基准中得到的代表不足,但频繁发生于真实世界任务中。为此,我们构建了扩展的近实世界离线 RL 基准(NeoRL-2),其包含来自 7 个模拟任务的数据集以及相应的评估模拟器。对最新离线 RL 方法的基准测试结果表明,当前方法往往难以超过数据收集行为策略,凸显了需要更有效方法的需求。我们希望 NeoRL-2 能加速强化学习算法用于实际应用的开发。该基准项目页面位于 https://github.com/polixir/NeoRL2。

关键词

引用

@article{arxiv.2503.19267,
  title  = {NeoRL-2: Near Real-World Benchmarks for Offline Reinforcement Learning with Extended Realistic Scenarios},
  author = {Songyi Gao and Zuolin Tu and Rong-Jun Qin and Yi-Hao Sun and Xiong-Hui Chen and Yang Yu},
  journal= {arXiv preprint arXiv:2503.19267},
  year   = {2025}
}