风险厌恶的贝叶斯自适应强化学习
机器学习
2021-10-27 v2 人工智能
摘要
本文研究风险厌恶的贝叶斯自适应强化学习。我们提出在贝叶斯自适应马尔可夫决策过程(MDP)中优化总回报的条件风险价值(CVaR)的问题。我们证明,在此设定下优化 CVaR 的策略对由 MDP 上的先验分布导致的参数不确定性以及由 MDP 固有随机性导致的内部不确定性均是风险厌恶的。我们将该问题重新表述为一个双人随机博弈,并提出了一种基于蒙特卡洛树搜索与贝叶斯优化的近似算法。我们的实验表明,该方法在此问题上显著优于基线方法。
引用
@article{arxiv.2102.05762,
title = {Risk-Averse Bayes-Adaptive Reinforcement Learning},
author = {Marc Rigter and Bruno Lacerda and Nick Hawes},
journal= {arXiv preprint arXiv:2102.05762},
year = {2021}
}
备注
Full version of NeurIPS 2021 paper