基于价值分布模型的强化学习
机器学习
2024-09-04 v2 人工智能
摘要
量化策略长期性能的不确定性对于解决序列决策任务十分重要。我们从基于模型的贝叶斯强化学习视角研究该问题,其目标是学习由马尔可夫决策过程的参数(认知)不确定性所诱导的价值函数后验分布。先前的工作将分析限制于价值分布的数个矩或强加特定分布形状(例如高斯分布)。受分布式强化学习启发,我们引入了一个贝尔曼算子,其不动点为价值分布函数。基于我们的理论,我们提出了 Epistemic Quantile-Regression (EQR),一种学习价值分布函数的基于模型的算法。我们将 EQR 与 soft actor-critic (SAC) 结合,以使用所学价值分布的任意可微目标函数进行策略优化。在多个连续控制任务上的评估显示了相对于基于模型与无模型算法的性能优势。代码见 https://github.com/boschresearch/dist-mbrl。
引用
@article{arxiv.2308.06590,
title = {Value-Distributional Model-Based Reinforcement Learning},
author = {Carlos E. Luis and Alessandro G. Bottero and Julia Vinogradska and Felix Berkenkamp and Jan Peters},
journal= {arXiv preprint arXiv:2308.06590},
year = {2024}
}