f-散度约束的策略改进
机器学习
2018-04-05 v2 人工智能
机器学习
摘要
为了确保学习的稳定性,最先进的广义策略迭代算法在策略改进步骤中加入了信任域约束以限制信息损失。信任域的大小通常由 Kullback-Leibler(KL)散度确定,它不仅很好地刻画了距离的概念,而且能得到闭式解。在本文中,我们考虑更一般的 f-散度类,并推导出相应的策略更新规则。通用解通过 f 的凸共轭函数的导数表示,并将 KL 解作为特例包含在内。在 f-散度类中,我们进一步关注单参数族的 -散度,以研究散度选择对策略改进的影响。对于不同的 值,出现了已知的和新的策略更新。我们表明,每种类型的策略更新都伴随着由所选 f-散度产生的兼容策略评估。有趣的是,均方 Bellman 误差最小化与带 Pearson -散度惩罚的策略评估密切相关,而 KL 散度导致软最大(soft-max)策略更新和对数-和-指数(log-sum-exp)评论家。我们对不同 值的解进行了渐近分析,并展示了在多臂老虎机问题和常见标准强化学习问题上使用不同散度函数的效果。
引用
@article{arxiv.1801.00056,
title = {f-Divergence constrained policy improvement},
author = {Boris Belousov and Jan Peters},
journal= {arXiv preprint arXiv:1801.00056},
year = {2018}
}