中文

STOPS:基于短期的波动率控制策略搜索及其全局收敛性

机器学习 2022-07-25 v5

摘要

将现有的风险规避方法部署到实际应用中仍然具有挑战性。原因有多方面,包括缺乏全局最优性保证以及需要从长期连续轨迹中学习。长期连续轨迹容易涉及访问危险状态,这在风险规避设置中是一个主要问题。本文提出了基于短期的波动率控制策略搜索 (STOPS),这是一种通过从短期轨迹而非长期轨迹中学习来解决风险规避问题的新算法。短期轨迹生成更灵活,并且可以避免访问危险状态的危险。通过使用带有过参数化两层神经网络的行动者-评论家方案,我们的算法利用近端策略优化和自然策略梯度以次线性速率找到全局最优策略,其有效性可与风险中性策略搜索方法的最新收敛速率相媲美。该算法在具有挑战性的 Mujoco 机器人仿真任务上,使用均值-方差评估指标进行了评估。理论分析和实验结果都表明,STOPS 在现有风险规避策略搜索方法中达到了最先进的性能水平。

关键词

引用

@article{arxiv.2201.09857,
  title  = {STOPS: Short-Term-based Volatility-controlled Policy Search and its Global Convergence},
  author = {Liangliang Xu and Daoming Lyu and Yangchen Pan and Aiwen Jiang and Bo Liu},
  journal= {arXiv preprint arXiv:2201.09857},
  year   = {2022}
}