一种带下行风险约束的自然策略梯度 actor-critic 算法
机器学习
2020-07-09 v1 人工智能
计算金融
投资组合管理
机器学习
摘要
现有的风险敏感强化学习工作——无论是针对对称还是下行风险度量——通常直接使用蒙特卡洛估计策略梯度。虽然该方法产生无偏梯度估计,但与时序差分方法相比,它还存在高方差和样本效率降低的问题。在本文中,我们研究对下行风险具有规避的预测与控制问题,该风险由回报的下偏矩度量。我们引入一个新的贝尔曼方程,对下偏矩给出上界,从而规避其非线性。我们证明该下偏矩代理是一个压缩映射,并通过方差分解直观说明算法的稳定性。这使得下偏矩的样本高效在线估计成为可能。对于风险敏感控制,我们将近期用于寻找约束策略的 actor-critic 方法 Reward Constrained Policy Optimization 实例化为我们的下偏矩代理。我们将该方法扩展为使用自然策略梯度,并在三个风险敏感强化学习基准问题上展示了我们方法的有效性。
引用
@article{arxiv.2007.04203,
title = {A Natural Actor-Critic Algorithm with Downside Risk Constraints},
author = {Thomas Spooner and Rahul Savani},
journal= {arXiv preprint arXiv:2007.04203},
year = {2020}
}
备注
14 pages, 5 figures