通过两阶段 KL 惩罚实现保证信赖域优化
机器学习
2023-12-12 v1
摘要
由于计算效率高和理论简单,on-policy 强化学习 (RL) 已成为解决序贯决策问题的流行框架。一些 on-policy 方法保证每次策略更新都被限制在相对于先前策略的信赖域内,以确保训练稳定性。这些方法通常需要计算密集型的非线性优化,或要求特定形式的动作分布。在这项工作中,我们表明仅应用 KL 惩罚就几乎足以强制执行此类信赖域。然后,我们表明引入一个“修正”阶段足以保证在每次策略更新时都强制执行信赖域,而在实践中仅增加不到 5% 的额外梯度步数。我们将由此产生的算法称为 FixPO,它能够训练各种策略架构和动作空间,易于实现,并产生与其他信赖域方法相当的结果。
引用
@article{arxiv.2312.05405,
title = {Guaranteed Trust Region Optimization via Two-Phase KL Penalization},
author = {K. R. Zentner and Ujjwal Puri and Zhehui Huang and Gaurav S. Sukhatme},
journal= {arXiv preprint arXiv:2312.05405},
year = {2023}
}