方差的替代方案:用于风险厌恶策略梯度的基尼偏差
机器学习
2023-11-06 v3 人工智能
摘要
由于清晰的数学定义和易于解释,限制策略回报的方差是风险厌恶强化学习 (RL) 中一种流行的选择。传统方法直接限制总回报方差。近期方法限制每步奖励方差作为替代。我们深入考察了这些基于方差的方法的局限性,例如对数值尺度的敏感性和对策略学习的阻碍,并提出使用一种替代的风险度量——基尼偏差——作为替代。我们研究了这一新风险度量的各种性质,并推导出一种策略梯度算法以最小化它。在能够明确定义风险厌恶的领域的实证评估表明,我们的算法能够缓解基于方差的风险度量的局限性,并在其他算法无法学到合理策略时,以低方差和基尼偏差实现高风险调整后的高回报。
引用
@article{arxiv.2307.08873,
title = {An Alternative to Variance: Gini Deviation for Risk-averse Policy Gradient},
author = {Yudong Luo and Guiliang Liu and Pascal Poupart and Yangchen Pan},
journal= {arXiv preprint arXiv:2307.08873},
year = {2023}
}
备注
NeurIPS 2023