基于不确定性驱动的轨迹截断用于离线强化学习中的数据增强
机器学习
2023-07-27 v2 人工智能
摘要
借助训练好的环境动力学,基于模型的离线强化学习(RL)算法通常能从固定规模的数据集(甚至某些质量较差的数据集)中成功学习到良好的策略。然而遗憾的是,无法保证训练好的动力学模型生成的样本是可靠的(例如,某些合成样本可能落在静态数据集的支持区域之外)。为解决此问题,我们提出带不确定性的轨迹截断(TATU),当沿轨迹累积的不确定性过大时自适应地截断合成轨迹。我们从理论上给出了 TATU 的性能界以证明其益处。为实证展示 TATU 的优势,我们首先将其与两种经典的基于模型的离线 RL 算法 MOPO 和 COMBO 结合。此外,我们将 TATU 与若干现成的无模型离线 RL 算法(如 BCQ)集成。在 D4RL 基准上的实验结果表明,TATU 显著提升了它们的性能,且常幅度颇大。代码已公开。
引用
@article{arxiv.2304.04660,
title = {Uncertainty-driven Trajectory Truncation for Data Augmentation in Offline Reinforcement Learning},
author = {Junjie Zhang and Jiafei Lyu and Xiaoteng Ma and Jiangpeng Yan and Jun Yang and Le Wan and Xiu Li},
journal= {arXiv preprint arXiv:2304.04660},
year = {2023}
}