CIM-PPO:基于 Liu 相关熵诱导度量的近端策略优化
机器学习
2024-10-30 v3 人工智能
摘要
作为一种流行的深度强化学习 (DRL) 算法,近端策略优化 (PPO) 在许多复杂任务中展现出显著成效。根据代理中的惩罚机制,PPO 可分为带 KL 散度的 PPO (PPO-KL) 与带裁剪的 PPO (PPO-Clip)。本文中,我们分析 KL 散度中的不对称性对 PPO-KL 的影响,并指出当此不对称性显著时,会误导代理的改进。为解决该问题,我们将 PPO-KL 表示为内积形式,并证明 KL 散度是欧氏空间中的相关熵诱导度量 (Correntropy Induced Metric, CIM)。随后,我们将 PPO-KL 扩展到再生核希尔伯特空间 (RKHS),用 RKHS 重新定义内积,并提出 PPO-CIM 算法。此外,本文指出 PPO-CIM 算法在策略梯度中具有更低的计算代价,并证明当核满足某些条件时 PPO-CIM 能保证新策略位于信任域内。最后,我们基于六个 Mujoco 连续动作任务设计实验以验证所提算法。实验结果验证了 KL 散度的不对称性会影响 PPO-KL 的策略改进,并表明 PPO-CIM 在大多数任务中表现优于 PPO-KL 与 PPO-Clip。
引用
@article{arxiv.2110.10522,
title = {CIM-PPO:Proximal Policy Optimization with Liu-Correntropy Induced Metric},
author = {Yunxiao Guo and Han Long and Xiaojun Duan and Kaiyuan Feng and Maochu Li and Xiaying Ma},
journal= {arXiv preprint arXiv:2110.10522},
year = {2024}
}
备注
This work has been submitted to the Elsevier for possible publication