具有自适应探索的近端策略优化
机器学习
2024-05-09 v1 人工智能
摘要
引入具有自适应探索的近端策略优化(axPPO)作为一种新颖的学习算法。本文研究了强化学习中探索-利用的权衡,旨在为强化学习算法设计提供新的见解。所提出的自适应探索框架根据智能体最近的表现动态调整训练期间的探索幅度。我们提出的方法在学习效率上优于标准PPO算法,特别是在学习过程初期需要大量探索行为时。
引用
@article{arxiv.2405.04664,
title = {Proximal Policy Optimization with Adaptive Exploration},
author = {Andrei Lixandru},
journal= {arXiv preprint arXiv:2405.04664},
year = {2024}
}