风险敏感强化学习:一种应对奖励不确定性的鞅方法
机器学习
2020-09-16 v2 风险管理
机器学习
摘要
我们引入一种新框架,以考量序列决策问题中对奖励不确定性的敏感性。迄今所研究的马尔可夫决策过程的风险敏感公式侧重于累积奖励整体的分布,而我们旨在学习对奖励的不确定/随机本质敏感的策略,这在某些情形下具有概念上更有意义的优势。为此,我们基于随机过程的 Doob 分解给出累积奖励中所含随机性的新分解,并引入一个新概念工具——\textit{混沌变差}——其可严格解释为与累积奖励过程相关的鞅分量的风险度量。我们在强化学习方面进行创新,将此新风险敏感方法融入无模型算法(包括策略梯度和基于价值函数的方法),并在网格世界和投资组合优化问题上阐明其相关性。
引用
@article{arxiv.2006.12686,
title = {Risk-Sensitive Reinforcement Learning: a Martingale Approach to Reward Uncertainty},
author = {Nelson Vadori and Sumitra Ganesh and Prashant Reddy and Manuela Veloso},
journal= {arXiv preprint arXiv:2006.12686},
year = {2020}
}
备注
Published at ICAIF 2020: ACM International Conference on AI in Finance