策略梯度方法的 mollification 效应
机器学习
2024-05-29 v1 人工智能
机器人学
摘要
策略梯度方法已经使深度强化学习(RL)能够接近涉及高度非线性动力学、生成复杂非光滑优化景观的挑战性连续控制问题。我们发展了一个严格的框架,用以理解策略梯度方法如何使非光滑优化景观平滑化以有效地进行策略搜索,以及这种做法的潜在缺点:尽管使目标函数更光滑、更易优化,但随机目标与原始问题的偏离程度更远。我们演示了策略梯度方法等价于求解逆热方程。遵循逆热方程从偏微分方程理论中引出的 Ill-posedness,我们提出了针对随机性下策略梯度的一个根本性挑战。此外,我们将这一局限性与调和分析中的不确定性原理相联系,以理解在 RL 中使用随机策略进行探索的效应。我们也提供了实验结果,以说明在实践中 mollification 效应的积极和消极方面。
关键词
引用
@article{arxiv.2405.17832,
title = {Mollification Effects of Policy Gradient Methods},
author = {Tao Wang and Sylvia Herbert and Sicun Gao},
journal= {arXiv preprint arXiv:2405.17832},
year = {2024}
}
备注
19 pages, 41 figures