融合 Dropout 不确定性与轨迹采样的一种实用基于概率模型的深度强化学习
系统与控制
2023-09-21 v1 人工智能
机器学习
系统与控制
摘要
本文解决当前基于神经网络的基于概率模型的强化学习(MBRL)的预测稳定性、预测精度与控制能力问题。提出一种新颖方法 dropout-based probabilistic ensembles with trajectory sampling(DPETS,基于 dropout 的概率集成与轨迹采样),其通过在一个框架中结合 Monte-Carlo dropout 与轨迹采样来稳定预测系统不确定性。其损失函数旨在纠正神经网络的拟合误差,以更准确预测概率模型。其策略中的状态传播被扩展以过滤偶然不确定性,从而获得更优控制能力。在若干带额外扰动的 Mujoco 基准控制任务与一个实际机械臂操作任务上评估,DPETS 在平均回报与收敛速度上均优于相关 MBRL 方法,同时以显著样本效率取得优于知名无模型基线的性能。DPETS 的开源代码见 https://github.com/mrjun123/DPETS。
引用
@article{arxiv.2309.11089,
title = {Practical Probabilistic Model-based Deep Reinforcement Learning by Integrating Dropout Uncertainty and Trajectory Sampling},
author = {Wenjun Huang and Yunduan Cui and Huiyun Li and Xinyu Wu},
journal= {arXiv preprint arXiv:2309.11089},
year = {2023}
}