强化学习中的实用风险度量
机器学习
2019-08-23 v1 机器学习
摘要
强化学习 (RL) 的实际应用通常涉及风险考量。我们研究了一种基于蒙特卡洛模拟的风险度量广义近似方案,其中风险度量不必是*一致的*。我们证明,即使在简单问题中,诸如奖励-去方差之类的度量也不能以令人满意的方式捕获风险。此外,我们展示了如何从模型的实现中推导出风险度量。我们提出了一种用于估计风险的神经架构,并建议使用风险评论家架构,该架构可用于在一般风险度量下优化策略。我们通过实验证明了我们方法的有效性,以此结束我们的工作。
引用
@article{arxiv.1908.08379,
title = {Practical Risk Measures in Reinforcement Learning},
author = {Dotan Di Castro and Joel Oren and Shie Mannor},
journal= {arXiv preprint arXiv:1908.08379},
year = {2019}
}