KL 约束近似策略迭代中的优化问题
机器学习
2021-02-15 v1 机器学习
摘要
许多强化学习算法可视为近似策略迭代(API)的变体。虽然标准 API 常表现不佳,但已有研究表明可通过用 KL 散度对每次策略更新进行正则化来稳定学习。TRPO、MPO 和 VMPO 等流行的实用算法将正则化替换为对连续策略 KL 散度的约束,认为这更易于实现与调参。在本工作中,我们更详细地研究了这一实现选择。我们比较了将 KL 散度用作约束与用作正则化,并指出了广泛使用的约束式方法存在的若干优化问题。我们表明,即便在可精确求解约束问题的简单实例上,约束算法也无法保证收敛,且实际上会产生线性期望后悔。在使用 softmax 策略的近似实现下,我们表明正则化可改善原始目标的优化地形。我们在多个赌博机与 RL 环境中对这些现象进行了实证展示。
引用
@article{arxiv.2102.06234,
title = {Optimization Issues in KL-Constrained Approximate Policy Iteration},
author = {Nevena Lazić and Botao Hao and Yasin Abbasi-Yadkori and Dale Schuurmans and Csaba Szepesvári},
journal= {arXiv preprint arXiv:2102.06234},
year = {2021}
}