在线贝叶斯风险厌恶强化学习
机器学习
2025-09-18 v1
摘要
本文研究了强化学习(RL)中贝叶斯风险厌恶形式的研究。为解决因数据不足导致的认知不确定性,我们采用贝叶斯风险马尔可夫决策过程(Bayesian Risk Markov Decision Process, BRMDP)以考虑未知底层模型的参数不确定性。我们推导了贝叶斯风险值函数与原始值函数在真实未知分布下的差异的渐近正态性。结果表明,贝叶斯风险厌恶方法倾向于悲观地低估原始值函数。这种差异随着风险厌恶程度的加强而增加,但随着数据量的增加而减小。随后,我们在在线强化学习以及在线情境多臂老虎机(contextual multi-arm bandits, CMAB)的设置中利用了这一自适应属性。CMAB 是在线强化学习的一个特例。我们为通用 RL 问题和 CMAB 问题分别提供了两种基于后验抽样的程序。我们建立了亚线性后悔界,其中后悔定义为 RL 和 CMAB 设置下的常规后悔。此外,我们为 CMAB 设置下的贝叶斯风险后悔建立了亚线性后悔界。最后,我们进行数值实验以展示所提出算法在解决认知不确定性方面的有效性,并验证了理论性质。
引用
@article{arxiv.2509.14077,
title = {Online Bayesian Risk-Averse Reinforcement Learning},
author = {Yuhao Wang and Enlu Zhou},
journal= {arXiv preprint arXiv:2509.14077},
year = {2025}
}