应对未知:悲观离线强化学习
机器学习
2021-11-11 v1 机器人学
摘要
强化学习(RL)已被证明在智能体可通过与其运行环境主动交互来学习策略的领域中是有效的。然而,若将 RL 方案改为离线设定,即智能体仅能通过静态数据集更新其策略,则离线强化学习的一个主要问题随之显现,即分布偏移。我们提出了一种悲观离线强化学习(PessORL)算法,通过操纵值函数主动将智能体引回其熟悉的区域。我们关注由分布外(OOD)状态引起的问题,并刻意对训练数据集中缺失的状态处的高值进行惩罚,从而使得学习到的悲观值函数在状态空间内任何地方都以下界逼近真实值。我们在多种基准任务上评估了 PessORL 算法,结果表明,与仅考虑 OOD 动作的方法相比,我们的方法通过显式处理 OOD 状态获得了更好的性能。
引用
@article{arxiv.2111.05440,
title = {Dealing with the Unknown: Pessimistic Offline Reinforcement Learning},
author = {Jinning Li and Chen Tang and Masayoshi Tomizuka and Wei Zhan},
journal= {arXiv preprint arXiv:2111.05440},
year = {2021}
}
备注
Published in 5th Annual Conference on Robot Learning (CoRL 2021)