中文

连续控制中重尾策略搜索的样本复杂性与亚稳态

机器学习 2023-01-04 v2 人工智能 系统与控制 系统与控制 最优化与控制 机器学习

摘要

强化学习是一种交互式决策框架,奖励随时间在无系统动力学模型的情况下逐步揭示。由于其向连续空间的扩展能力,我们关注策略搜索,即利用随机策略梯度(PG)更新迭代改进参数化策略。在表格型马尔可夫决策问题(MDP)中,在持续探索与合适参数化下,可获得全局最优。相比之下,在连续空间中,非凸性带来病态挑战,现有收敛结果大多局限于平稳点或任意局部极值。为弥补此差距,我们通过由尾指数参数 alpha 定义的重尾分布所刻画的策略参数化,向连续空间中的持续探索迈进,这增加了在状态空间中跳跃的可能性。如此一来,PG 中常见的得分函数光滑条件不再成立。因此,我们建立了到平稳点的收敛速率如何依赖于策略尾指数 alpha、Hölder 连续参数、可积条件以及此处首次引入的探索容忍参数。进一步,我们通过恰当定义的马尔可夫链的退出与转移时间分析,刻画了局部极大值集合对尾指数的依赖,识别出与更重尾的 Levy 过程相关的策略收敛到更宽的峰值。该现象在监督学习中提升了对扰动的稳定性,我们证实其同样体现在策略搜索性能的提升中,尤其在短视与远见激励错位时。

关键词

引用

@article{arxiv.2106.08414,
  title  = {On the Sample Complexity and Metastability of Heavy-tailed Policy Search in Continuous Control},
  author = {Amrit Singh Bedi and Anjaly Parayil and Junyu Zhang and Mengdi Wang and Alec Koppel},
  journal= {arXiv preprint arXiv:2106.08414},
  year   = {2023}
}