中文

具有有偏离线数据和不完美模拟器的强化学习基准

机器学习 2024-07-02 v1

摘要

在许多强化学习(RL)应用中,很难让智能体在现实世界中行动;例如自动驾驶汽车、医疗保健应用,甚至一些推荐系统。离线RL提供了一种无需在现实世界中探索即可训练智能体的方法,但常常面临由于数据分布偏移、覆盖范围有限以及环境表示不完整而导致的偏差。为了解决这些问题,实际应用尝试使用所谓的混合方法,将模拟器与基于的离线数据相结合。然而,由于系统复杂性以及信息缺失或不完整,构建可靠的模拟器本身通常具有挑战性。在这项工作中,我们概述了在RL中将离线数据与不完美模拟器相结合的四个主要挑战:模拟器建模误差、部分可观测性、状态和动作差异以及隐藏混杂。为了推动RL社区解决这些问题,我们构建了“机械论离线强化学习基准”(B4MRL),该基准为上述挑战提供了数据集-模拟器基准。我们的结果表明,此类基准对于未来的研究至关重要。

关键词

引用

@article{arxiv.2407.00806,
  title  = {Benchmarks for Reinforcement Learning with Biased Offline Data and Imperfect Simulators},
  author = {Ori Linial and Guy Tennenholtz and Uri Shalit},
  journal= {arXiv preprint arXiv:2407.00806},
  year   = {2024}
}