基于反探索的离线模型强化学习
机器学习
2024-08-21 v1 人工智能
摘要
基于模型的强化学习 (MBRL) 算法从收集的数据中学习动力学模型,并利用其生成合成轨迹以实现更快的学习。这在离线强化学习 (RL) 中尤其具有前景,因为数据在数量上可能有限,同时在覆盖范围和质量上也存在不足。离线 MBRL 的实用方法通常依赖动力学模型集成来防止对任一单个模型的利用,并提取不确定性估计以对远离数据集支持的状态的值施加惩罚。集成的不确定性估计在尺度上差异很大,这使得即使在相似任务上也难以良好地泛化超参数。本文提出了 Morse 基于模型的离线 RL (MoMo),将离线无模型 RL 中的反探索范式扩展到基于模型的空间。我们开发了 MoMo 的无模型和基于模型两种变体,并展示了无模型版本如何在不依赖大型集成的情况下利用显式不确定性估计来检测和处理分布外 (OOD) 状态。MoMo 使用反探索奖励来对抗值高估,并结合策略约束,以及使用截断函数来终止过度 OOD 的合成回放。实验结果表明,无模型和基于模型的 MoMo 均表现良好,且后者在大多数测试的 D4RL 数据集上优于先前的基于模型和无模型基线。
引用
@article{arxiv.2408.10713,
title = {Offline Model-Based Reinforcement Learning with Anti-Exploration},
author = {Padmanaba Srinivasan and William Knottenbelt},
journal= {arXiv preprint arXiv:2408.10713},
year = {2024}
}