通过重要性采样在自然策略梯度中复用历史轨迹:收敛性与收敛速率
机器学习
2025-03-06 v2 最优化与控制
摘要
强化学习为基于学习的控制提供了数学框架,其成功很大程度上取决于可利用的数据量。高效利用从先前策略获得的历史轨迹对于加速策略优化至关重要。经验证据表明,基于重要性采样的策略梯度方法表现良好。然而,现有文献往往忽视不同迭代间轨迹的相互依赖性,且良好的经验性能缺乏严格的理论依据。本文研究了一种通过重要性采样复用历史轨迹的自然策略梯度方法的变体。我们证明了所提出的梯度估计量的偏差是渐近可忽略的,所得算法是收敛的,并且复用过去轨迹有助于提高收敛速率。我们将所提出的估计量进一步应用于信任域策略优化等流行的策略优化算法。我们的理论结果在经典基准上得到了验证。
引用
@article{arxiv.2403.00675,
title = {Reusing Historical Trajectories in Natural Policy Gradient via Importance Sampling: Convergence and Convergence Rate},
author = {Yifan Lin and Yuhao Wang and Enlu Zhou},
journal= {arXiv preprint arXiv:2403.00675},
year = {2025}
}