中文

策略优化中的分形景观

机器学习 2024-01-23 v1 人工智能

摘要

策略梯度(policy gradient)是连续域深度强化学习(RL)的核心。尽管取得诸多成功,实践中常观察到使用策略梯度的 RL 训练可能因多种原因失败,即便在具有已知解的标准控制问题上也是如此。我们提出一个框架以理解策略梯度方法的一个固有局限:对于某些类别的 MDP,策略空间中的优化景观可能极其不平滑或呈分形,以至于从根本上不存在可供估计的梯度。我们借助混沌理论与非平滑分析的技术,分析策略优化目标的最大 Lyapunov 指数与 H"older 指数。此外,我们开发了一种实用方法,可从样本中估计目标函数的局部平滑度,以识别训练过程何时遭遇分形景观。我们通过实验展示策略优化的若干失败案例如何可由此类分形景观解释。

关键词

引用

@article{arxiv.2310.15418,
  title  = {Fractal Landscapes in Policy Optimization},
  author = {Tao Wang and Sylvia Herbert and Sicun Gao},
  journal= {arXiv preprint arXiv:2310.15418},
  year   = {2024}
}

备注

18 pages and 28 figures