基于模型的强化学习中深度状态空间模型的不确定性研究
机器学习
2022-10-18 v1
摘要
改进的状态空间模型,如循环状态空间模型(RSSMs),是基于模型的强化学习(RL)近期进展背后的关键因素。然而,尽管它们取得了经验上的成功,许多底层设计选择仍未被充分理解。我们表明 RSSMs 使用了次优推断方案,且用该推断训练的模型高估了真实系统的偶然不确定性。我们发现这种高估隐式地正则化了 RSSMs,使其能在基于模型的 RL 中成功。我们推测这种隐式正则化实现了与显式建模认知不确定性相同的功能,而后者对许多其他基于模型的 RL 方法至关重要。然而,高估偶然不确定性在准确估计它很重要的情况下也会损害性能,例如当我们必须处理遮挡、缺失观测或以不同频率融合传感器模态时。此外,隐式正则化是推断方案的副作用,而非严谨、原则性公式的结果,这使得分析或改进 RSSMs 变得困难。因此,我们提出了一种基于成熟组件建模偶然与认知不确定性的替代方法,称为变分循环卡尔曼网络(VRKN)。该方法使用卡尔曼更新在潜空间中进行精确平滑推断,并使用蒙特卡洛 Dropout 建模认知不确定性。由于卡尔曼更新,VRKN 可自然处理每个时间步观测数可变的缺失观测或传感器融合问题。我们的实验表明,在恰当捕捉偶然不确定性至关重要的任务中,使用 VRKN 替代 RSSM 可提升性能,同时在确定性标准基准上与之持平。
引用
@article{arxiv.2210.09256,
title = {On Uncertainty in Deep State Space Models for Model-Based Reinforcement Learning},
author = {Philipp Becker and Gerhard Neumann},
journal= {arXiv preprint arXiv:2210.09256},
year = {2022}
}
备注
Published in TMLR, October 2022