StaQ!用于策略镜像下降的扩展神经网络
机器学习
2025-06-18 v1 人工智能
摘要
在强化学习(RL)中,正则化已成为理论和实践中广泛使用的工具,通常基于熵奖励或约束连续策略的Kullback-Leibler散度。在实践中,这些方法已被证明可以改善探索性、鲁棒性和稳定性,催生了SAC和TRPO等流行的深度RL算法。策略镜像下降(PMD)是一个解决这一通用正则化策略优化问题的理论框架,但其闭式解涉及所有过去Q函数之和,在实践中不可行。我们提出并分析了仅保留最后 个Q函数在内存中的PMD类算法,并证明对于有限且足够大的 ,可以推导出收敛算法,在策略更新中不引入误差,这与先前的深度RL PMD实现不同。由此产生的StaQ算法具有强大的理论保证,与深度RL基线相比具有竞争力,同时表现出更小的性能振荡,为完全稳定的深度RL算法铺平了道路,并为策略镜像下降的实验提供了测试平台。
引用
@article{arxiv.2506.13862,
title = {StaQ it! Growing neural networks for Policy Mirror Descent},
author = {Alena Shilova and Alex Davey and Brahim Driss and Riad Akrour},
journal= {arXiv preprint arXiv:2506.13862},
year = {2025}
}
备注
44 pages, 12 figures