值函数中的基于模型的不确定性
机器学习
2023-03-08 v2 人工智能
机器学习
摘要
我们考虑在基于模型的强化学习中量化期望累积奖励不确定性的问题。具体而言,我们聚焦于刻画由MDP分布所诱导的值函数方差。先前工作通过求解所谓的“不确定性贝尔曼方程”对值的后验方差给出上界,但该过近似可能导致低效探索。我们提出一种新的不确定性贝尔曼方程,其解收敛于值的真实后验方差,并明确刻画了先前工作中的差距。此外,我们的不确定性量化技术易于集成到常见探索策略中,并可借助标准深度强化学习架构自然扩展到表格设定之外。在困难探索任务(包括表格与连续控制设定)中的实验表明,我们更尖锐的不确定性估计提升了样本效率。
引用
@article{arxiv.2302.12526,
title = {Model-Based Uncertainty in Value Functions},
author = {Carlos E. Luis and Alessandro G. Bottero and Julia Vinogradska and Felix Berkenkamp and Jan Peters},
journal= {arXiv preprint arXiv:2302.12526},
year = {2023}
}
备注
AISTATS 2023