面向风险感知策略优化的基于模型的值认知方差
机器学习
2024-09-18 v3 人工智能
摘要
我们考虑在基于模型的强化学习中量化预期累积奖励不确定性的问题。具体而言,我们专注于刻画由马尔可夫决策过程(MDP)上的分布所诱导的值的方差。先前的工作通过求解所谓的不确定性贝尔曼方程(UBE)来上界估计值的后验方差,但这种过度近似可能导致低效的探索。我们提出一个新的 UBE,其解收敛于值的真实后验方差,并在表格型探索问题中带来更低的遗憾。我们识别了将 UBE 理论应用于非表格型问题的挑战,并提出了一个合适的近似方法。基于此近似,我们引入了一种通用的策略优化算法——Q-不确定性软演员-评论家(QU-SAC),该算法只需极小的改动即可应用于风险寻求或风险规避的策略优化。在线和离线强化学习中的实验表明,与其他不确定性估计方法相比,性能有所提升。
引用
@article{arxiv.2312.04386,
title = {Model-Based Epistemic Variance of Values for Risk-Aware Policy Optimization},
author = {Carlos E. Luis and Alessandro G. Bottero and Julia Vinogradska and Felix Berkenkamp and Jan Peters},
journal= {arXiv preprint arXiv:2312.04386},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2302.12526