无限 horizon 风险厌恶动态规划中 Bellman 算子的压缩性
最优化与控制
2022-08-04 v1 应用统计
摘要
本文研究无限 horizon 的风险厌恶动态规划问题。首先,为使得问题良定义,给出所需假设。随后导出 Bellman 方程,该方程也可视为一个独立的强化学习问题。证明了 Bellman 算子为压缩映射,从而保证了用于动态规划及强化学习问题的多种求解算法的收敛性,我们在值迭代算法上予以演示。
引用
@article{arxiv.2208.01990,
title = {Contractivity of Bellman Operator in Risk Averse Dynamic Programming with Infinite Horizon},
author = {Martin Šmíd and Miloš Kopa},
journal= {arXiv preprint arXiv:2208.01990},
year = {2022}
}