中文

基于流式观测的贝叶斯风险厌恶 Q 学习

机器学习 2023-05-22 v1

摘要

我们考虑一个鲁棒强化学习问题,其中学习智能体从模拟的训练环境中学习。为了考虑由于数据缺乏导致的该训练环境与真实环境之间的模型误设定,我们采用无限时域的贝叶斯风险 MDP(BRMDP)表述,其利用贝叶斯后验来估计转移模型,并施加一个风险泛函以考虑模型不确定性。来自真实环境且不受智能体控制的观测周期性到达,并被智能体用来更新贝叶斯后验以减小模型不确定性。我们从理论上证明了 BRMDP 在鲁棒性与保守性之间取得了平衡,并进一步开发了一种多阶段贝叶斯风险厌恶 Q 学习算法,以求解带有来自真实环境的流式观测的 BRMDP。所提算法学习到一个风险厌恶却最优的策略,该策略依赖于真实世界观测的可用性。我们为所提算法提供了强收敛性的理论保证。

关键词

引用

@article{arxiv.2305.11300,
  title  = {Bayesian Risk-Averse Q-Learning with Streaming Observations},
  author = {Yuhao Wang and Enlu Zhou},
  journal= {arXiv preprint arXiv:2305.11300},
  year   = {2023}
}