基于期望条件风险度量的风险厌恶自然策略梯度方法的全局收敛性
机器学习
2026-01-21 v5 最优化与控制
机器学习
摘要
风险敏感强化学习(RL)已成为控制不确定结果风险并确保高度随机序贯决策问题中可靠表现的流行工具。尽管已有研究表明策略梯度方法在风险中性设定下能找到全局最优策略,但风险厌恶变体是否享有同样的全局收敛保证仍不清楚。本文考虑一类称为期望条件风险度量(ECRMs)的动态时间一致风险度量,并推导基于 ECRMs 的 RL 问题的自然策略梯度(NPG)更新。我们给出了所提风险厌恶 NPG 算法在 softmax 参数化与熵正则化下,于精确与不精确策略评估两种情形中的全局最优性与迭代复杂度。此外,我们在一个随机 Cliffwalk 环境中测试了我们的风险厌恶 NPG 算法,以证明方法的有效性。
引用
@article{arxiv.2301.10932,
title = {On the Global Convergence of Risk-Averse Natural Policy Gradient Methods with Expected Conditional Risk Measures},
author = {Xian Yu and Lei Ying},
journal= {arXiv preprint arXiv:2301.10932},
year = {2026}
}