中文

StaQ!用于策略镜像下降的扩展神经网络

机器学习 2025-06-18 v1 人工智能

摘要

在强化学习(RL)中,正则化已成为理论和实践中广泛使用的工具,通常基于熵奖励或约束连续策略的Kullback-Leibler散度。在实践中,这些方法已被证明可以改善探索性、鲁棒性和稳定性,催生了SAC和TRPO等流行的深度RL算法。策略镜像下降(PMD)是一个解决这一通用正则化策略优化问题的理论框架,但其闭式解涉及所有过去Q函数之和,在实践中不可行。我们提出并分析了仅保留最后 MM 个Q函数在内存中的PMD类算法,并证明对于有限且足够大的 MM,可以推导出收敛算法,在策略更新中不引入误差,这与先前的深度RL PMD实现不同。由此产生的StaQ算法具有强大的理论保证,与深度RL基线相比具有竞争力,同时表现出更小的性能振荡,为完全稳定的深度RL算法铺平了道路,并为策略镜像下降的实验提供了测试平台。

关键词

引用

@article{arxiv.2506.13862,
  title  = {StaQ it! Growing neural networks for Policy Mirror Descent},
  author = {Alena Shilova and Alex Davey and Brahim Driss and Riad Akrour},
  journal= {arXiv preprint arXiv:2506.13862},
  year   = {2025}
}

备注

44 pages, 12 figures