马尔可夫相干风险下策略梯度的收敛性与最优性研究
机器学习
2021-03-09 v2 人工智能
机器学习
摘要
为了在强化学习中建模风险厌恶,一个新兴的研究方向对熟悉的算法进行改造以优化相干风险泛函,该类泛函包含条件风险价值(CVaR)。由于在马尔可夫决策过程中优化相干风险较为困难,近期工作倾向于关注马尔可夫相干风险(MCR),一种时间一致的替代目标。尽管已针对该目标推导出策略梯度(PG)更新规则,但以下问题仍不清楚:(i)PG 是否能找到 MCR 的全局最优解;(ii)如何以可处理的方式估计梯度。在本文中,我们证明一般而言 MCR 目标(不同于期望回报)并非梯度主导的,且平稳点一般无法保证是全局最优的。此外,我们给出了所学策略次优性的一个紧上界,刻画了其对目标非线性和风险厌恶程度的依赖关系。针对问题(ii),我们提出了一种实用的 PG 实现,利用状态分布重加权来克服先前的局限。通过实验,我们证明当最优性间隙较小时,PG 能够学习风险敏感策略。然而,我们发现具有大次优性间隙的实例大量存在且易于构造,这为未来研究勾勒出一个重要挑战。
引用
@article{arxiv.2103.02827,
title = {On the Convergence and Optimality of Policy Gradient for Markov Coherent Risk},
author = {Audrey Huang and Liu Leqi and Zachary C. Lipton and Kamyar Azizzadenesheli},
journal= {arXiv preprint arXiv:2103.02827},
year = {2021}
}