中文

局部最优策略包含不稳定控制的示例

机器人学 2023-11-03 v4

摘要

我们提供了一种新的视角来理解为何强化学习(RL)在鲁棒性与泛化性方面存在困难。我们通过示例表明,局部最优策略对于某些动态参数可能包含不稳定控制,且对此类不稳定性的过拟合会损害鲁棒性和泛化性。对神经控制的收缩分析揭示,关于控制网络输入梯度存在稳定与不稳定控制之间的边界。忽略这些稳定性边界,如果某些动作能提高期望回报,学习智能体可能将那些对某些动态参数引起不稳定性的动作标记为高价值动作。此类不稳定性的较小比例在实证研究中可能未引起注意,却是实际应用的隐患。这些不稳定性可通过过拟合显现,导致鲁棒性和泛化失败。我们提出稳定性约束和终端约束来解决该问题,并以近端策略优化示例进行了演示。

关键词

引用

@article{arxiv.2209.07324,
  title  = {Example When Local Optimal Policies Contain Unstable Control},
  author = {Bing Song and Jean-Jacques Slotine and Quang-Cuong Pham},
  journal= {arXiv preprint arXiv:2209.07324},
  year   = {2023}
}