中文

面向重尾奖励的鲁棒离线强化学习

机器学习 2024-04-02 v2 人工智能 机器学习

摘要

本文致力于增强离线强化学习(RL)在充斥重尾奖励场景下的鲁棒性,此类情形在现实应用中十分普遍。我们分别提出两种算法框架 ROAM 与 ROOM,用于鲁棒离策略评估与离线策略优化(OPO)。我们框架的核心在于将均值中位数(median-of-means)方法与离线 RL 进行策略性结合,从而对价值函数估计量实现直接的不确定性估计。这不仅遵循了 OPO 中的悲观原则,也能妥善处理重尾奖励。理论结果与大量实验表明,我们的两个框架在记录数据集呈现重尾奖励分布时优于现有方法。所提方法的实现见 https://github.com/Mamba413/ROOM。

关键词

引用

@article{arxiv.2310.18715,
  title  = {Robust Offline Reinforcement learning with Heavy-Tailed Rewards},
  author = {Jin Zhu and Runzhe Wan and Zhengling Qi and Shikai Luo and Chengchun Shi},
  journal= {arXiv preprint arXiv:2310.18715},
  year   = {2024}
}

备注

23 pages, 6 figures. Proceedings of the 27th International Conference on Artificial Intelligence and Statistics (AISTATS) 2024