正则化马尔可夫决策过程中 Bregman 散度与值函数之间的联系
机器学习
2022-11-08 v4 人工智能
最优化与控制
摘要
在这篇短文中,我们推导了正则化马尔可夫决策过程中从当前策略到最优策略的 Bregman 散度与当前值函数次优性之间的关系。该结果对多任务强化学习、离线强化学习以及函数近似下的后悔分析等具有启示意义。
关键词
引用
@article{arxiv.2210.12160,
title = {On the connection between Bregman divergence and value in regularized Markov decision processes},
author = {Brendan O'Donoghue},
journal= {arXiv preprint arXiv:2210.12160},
year = {2022}
}