中文

ZORMS-LfD: 基于零阶随机矩阵搜索的示教学习

机器学习 2025-07-24 v1 数值分析 系统与控制 系统与控制 数值分析 最优化与控制

摘要

我们提出了用于示教学习的零阶随机矩阵搜索(ZORMS-LfD)。ZORMS-LfD能够从专家演示中学习连续时间和离散时间约束最优控制问题的代价、约束和动力学,且无需学习损失景观的光滑性。相比之下,现有最先进的一阶方法要求存在并计算代价、约束、动力学和学习损失相对于状态、控制和/或参数的梯度。大多数现有方法也专门针对离散时间,而连续时间下的约束问题仅得到粗略的关注。我们证明,在各种基准问题上,ZORMS-LfD在学习损失和计算时间方面均达到或超越了最先进方法的性能。在无约束的连续时间基准问题上,ZORMS-LfD实现了与最先进一阶方法相似的损失性能,同时计算时间减少了80%以上。在没有专门最先进方法的约束连续时间基准问题上,ZORMS-LfD被证明优于常用的无梯度Nelder-Mead优化方法。

关键词

引用

@article{arxiv.2507.17096,
  title  = {ZORMS-LfD: Learning from Demonstrations with Zeroth-Order Random Matrix Search},
  author = {Olivia Dry and Timothy L. Molloy and Wanxin Jin and Iman Shames},
  journal= {arXiv preprint arXiv:2507.17096},
  year   = {2025}
}