中文

正则化马尔可夫决策过程中 Bregman 散度与值函数之间的联系

机器学习 2022-11-08 v4 人工智能 最优化与控制

摘要

在这篇短文中,我们推导了正则化马尔可夫决策过程中从当前策略到最优策略的 Bregman 散度与当前值函数次优性之间的关系。该结果对多任务强化学习、离线强化学习以及函数近似下的后悔分析等具有启示意义。

关键词

引用

@article{arxiv.2210.12160,
  title  = {On the connection between Bregman divergence and value in regularized Markov decision processes},
  author = {Brendan O'Donoghue},
  journal= {arXiv preprint arXiv:2210.12160},
  year   = {2022}
}