通过对偶域中分布风险实现的谨慎强化学习
机器学习
2020-03-02 v1 人工智能
机器学习
系统与控制
系统与控制
最优化与控制
摘要
我们研究由状态和动作空间可数有限的马尔可夫决策过程(MDP)定义的强化学习问题中风险敏感策略的估计。先前的努力主要深受风险敏感MDP具有时间不一致性这一事实带来的计算挑战的困扰。为缓解此问题,我们提出风险的新定义,称之为谨慎(caution),作为加在强化学习线性规划(LP)公式的对偶目标上的惩罚函数。谨慎度量策略的分布风险,其为策略长期状态占用分布的函数。为以在线无模型方式求解该问题,我们提出一种使用Kullback-Leibler(KL)散度作为邻近项的原始-对偶方法的随机变体。我们确定,该方案达到近似最优解所需的迭代次数/样本量对状态和动作空间基数的依赖是紧的,但在其对风险度量梯度无穷范数的依赖上有所不同。实验证明了该方法在无需额外计算负担的情况下提高奖励积累可靠性的优点。
引用
@article{arxiv.2002.12475,
title = {Cautious Reinforcement Learning via Distributional Risk in the Dual Domain},
author = {Junyu Zhang and Amrit Singh Bedi and Mengdi Wang and Alec Koppel},
journal= {arXiv preprint arXiv:2002.12475},
year = {2020}
}