通过分位数贝叶斯风险MDP演化在线强化学习中的鲁棒性-探索权衡
机器学习
2026-05-26 v1
摘要
在在线强化学习中,数据稀缺会产生认知不确定性,使得鲁棒性在学习早期很重要,而充分的探索对于学习真实环境的最优策略是必需的。我们通过一个分位数贝叶斯风险感知马尔可夫决策过程(BR-MDP)来研究这种时变的鲁棒性-探索权衡,其中分位数水平控制后验不确定性如何进入Bellman备份。我们通过分位数BR-MDP值与真实环境值之间差异的渐近正态性结果来刻画这种控制。该结果表明,上/下尾分位数会诱导对认知不确定性的乐观/悲观态度,并且乐观/悲观的程度随着数据的积累而减小。基于这一刻画,我们提出了一种在线贝叶斯风险感知算法,该算法具有自适应分位数调度,早期强调鲁棒性,并逐渐鼓励探索较少访问的状态-动作对。我们建立了关于真实最优值和最优BR-MDP鲁棒值的次线性贝叶斯遗憾界。数值实验在探索需求型和探索成本高昂型环境中均表现出强劲性能。
引用
@article{arxiv.2605.24345,
title = {Evolving Robustness--Exploration Trade-off in Online Reinforcement Learning via Quantile Bayesian Risk MDPs},
author = {Meichen Song and Yuhao Wang and Enlu Zhou},
journal= {arXiv preprint arXiv:2605.24345},
year = {2026}
}