通过稀疏参数空间探索实现高效的在线策略强化学习
机器学习
2025-10-01 v1 人工智能
摘要
诸如近端策略优化之类的策略梯度方法通常沿单一随机梯度方向进行更新,使得参数空间中丰富的局部结构未被探索。先前的工作表明,代理梯度与真实奖励景观之间的相关性往往很差。基于这一洞察,我们将迭代内策略检查点所张成的参数空间可视化,并揭示性能更优的解往往位于附近未被探索的区域。为了利用这一机会,我们引入了 ExploRLer,这是一个可插拔的流水线,可与 PPO 和 TRPO 等在线策略算法无缝集成,系统性地探测代理在线策略梯度更新附近未被探索的邻域。在不增加梯度更新次数的情况下,ExploRLer 在复杂的连续控制环境中取得了相对于基线的显著提升。我们的结果表明,迭代级别的探索为增强在线策略强化学习提供了一种实用且有效的方法,并为代理目标的局限性提供了新的视角。
引用
@article{arxiv.2509.25876,
title = {Efficient On-Policy Reinforcement Learning via Exploration of Sparse Parameter Space},
author = {Xinyu Zhang and Aishik Deb and Klaus Mueller},
journal= {arXiv preprint arXiv:2509.25876},
year = {2025}
}
备注
16 pages; 7 figures