Plan To Predict:为基于模型的强化学习学习一种预见不确定性的模型
机器学习
2023-01-23 v1
摘要
在基于模型的强化学习(MBRL)中,模型学习至关重要,因为不准确的模型会通过生成误导性样本使策略学习产生偏差。然而,学习准确的模型可能很困难,因为策略持续更新,用于模型学习的已访问状态分布也随之偏移。先前的方法通过量化模型生成样本的不确定性来缓解此问题。然而,这些方法仅在样本生成后被动地量化不确定性,而非在模型轨迹落入那些高度不确定区域之前预见不确定性。由此产生的低质量样本会导致不稳定的学习目标并阻碍策略的优化。此外,模型虽被学习以最小化单步预测误差,但通常被用于多步预测,导致模型学习目标与使用目标之间的不匹配。为此,我们提出 \emph{Plan To Predict} (P2P),一种 MBRL 框架,它通过反向将模型视为决策者、将当前策略视为动力学,将模型展开(rollout)过程视为序贯决策问题。如此,模型可快速适应当前策略,并在生成轨迹时预见多步未来不确定性。理论上,我们证明 P2P 的性能可通过近似优化真实环境回报的下界得到保证。实验结果表明,P2P 在多个具有挑战性的基准任务上取得了最先进的性能。
引用
@article{arxiv.2301.08502,
title = {Plan To Predict: Learning an Uncertainty-Foreseeing Model for Model-Based Reinforcement Learning},
author = {Zifan Wu and Chao Yu and Chen Chen and Jianye Hao and Hankz Hankui Zhuo},
journal= {arXiv preprint arXiv:2301.08502},
year = {2023}
}
备注
Accepted by NeurIPS2022