构型路径控制
机器人学
2023-02-14 v1 机器学习
系统与控制
系统与控制
摘要
强化学习方法常产生脆弱策略——即在训练期间表现良好,但在直接训练经验之外泛化能力差,从而在微小扰动下变得不稳定的策略。为解决此问题,我们提出一种在构型路径空间中稳定控制策略的方法。该方法应用于训练后,纯粹依赖于训练期间产生的数据以及瞬时控制矩阵估计。该方法在平面双足行走器承受多种扰动下进行了实证评估。将通过强化学习获得的控制策略与其稳定化对应策略进行比较。在不同实验中,当以扰动幅度衡量时,我们发现稳定性提高了二至四倍。我们还提供了该方法的零动力学解释。
引用
@article{arxiv.2204.02471,
title = {Configuration Path Control},
author = {Sergey Pankov},
journal= {arXiv preprint arXiv:2204.02471},
year = {2023}
}
备注
12 pages, 3 figures, accepted for publication