中文

无限 horizon 风险厌恶动态规划中 Bellman 算子的压缩性

最优化与控制 2022-08-04 v1 应用统计

摘要

本文研究无限 horizon 的风险厌恶动态规划问题。首先,为使得问题良定义,给出所需假设。随后导出 Bellman 方程,该方程也可视为一个独立的强化学习问题。证明了 Bellman 算子为压缩映射,从而保证了用于动态规划及强化学习问题的多种求解算法的收敛性,我们在值迭代算法上予以演示。

关键词

引用

@article{arxiv.2208.01990,
  title  = {Contractivity of Bellman Operator in Risk Averse Dynamic Programming with Infinite Horizon},
  author = {Martin Šmíd and Miloš Kopa},
  journal= {arXiv preprint arXiv:2208.01990},
  year   = {2022}
}