基于双轨优势估计器的软策略优化
机器学习
2020-09-16 v1 机器学习
摘要
在强化学习(RL)中,我们总是期望智能体在训练初始阶段尽可能多地探索状态,并在后续阶段利用已探索的信息以发现回报最高的轨迹。基于该原则,本文通过引入熵并动态设置温度系数来软化近端策略优化,以平衡探索与利用的机会。在最大化期望奖励的同时,智能体也将寻求其他轨迹以避免局部最优策略。然而,熵带来的随机性增加会降低早期的训练速度。结合时序差分(TD)方法与广义优势估计器(GAE),我们提出双轨优势估计器(DTAE)以加速价值函数的收敛并进一步提升算法性能。在 Mujoco 环境上与其他同策略 RL 算法相比,所提方法不仅显著加快训练,还在累积回报上取得了最先进的结果。
引用
@article{arxiv.2009.06858,
title = {Soft policy optimization using dual-track advantage estimator},
author = {Yubo Huang and Xuechun Wang and Luobao Zou and Zhiwei Zhuang and Weidong Zhang},
journal= {arXiv preprint arXiv:2009.06858},
year = {2020}
}
备注
This is the accepted version of my manuscript (ICDM2020). Due to I should curtail my paper within 6 pages in this conference, now, I want to upload the complete version of my draft to readers