中文

面向灾难风险的极值理论强化学习策略梯度

机器学习 2024-07-01 v2 风险管理

摘要

本文针对序列决策过程中消除灾难性风险(即低频高严重性风险)的问题进行了研究。这一问题因在累积成本(负奖励)分布尾部的观测稀缺而具有挑战性。我们开发了一个基于极值理论推导的尾部风险近似值的策略梯度算法,称为 POTPG。数值实验表明,我们的方法在依赖经验分布的常见基准方法方面表现出色。本文还展示了其在金融风险管理中的应用,具体为金融期权的动态对冲。

关键词

引用

@article{arxiv.2406.15612,
  title  = {Catastrophic-risk-aware reinforcement learning with extreme-value-theory-based policy gradients},
  author = {Parisa Davar and Frédéric Godin and Jose Garrido},
  journal= {arXiv preprint arXiv:2406.15612},
  year   = {2024}
}

备注

The Python code to replicate the various numerical experiments of this paper is available at https://github.com/parisadavar/EVT-policy-gradient-RL