一种用于自主自行车控制的自适应数据驱动策略优化方法
系统与控制
2025-02-20 v1 机器人学
系统与控制
最优化与控制
摘要
本文提出了一种统一控制框架,将内环的反馈线性化(FL)控制器与外环的自适应数据驱动策略优化控制器相结合,以实现自主自行车的平衡。FL控制器能够稳定并部分线性化这一本质上不稳定且非线性的系统,但其性能会受到未建模动态和时变特性的影响。为了克服这些局限性,引入了DeePO控制器以增强适应性和鲁棒性。DeePO的初始控制策略是从一组有限的离线、持续激励的输入和状态数据中获取的。为了提高稳定性并补偿系统非线性和扰动,引入了促进鲁棒性的正则化项来优化初始策略,同时利用遗忘因子增强DeePO框架的自适应部分,以改善对时变动态的适应能力。所提出的DeePO+FL方法通过在装备了仪器的自主自行车上的仿真和真实世界实验进行了评估。结果表明,该方法优于仅使用FL的方法,能够更精确地跟踪参考倾斜角和倾斜角速率。
引用
@article{arxiv.2502.13676,
title = {An Adaptive Data-Enabled Policy Optimization Approach for Autonomous Bicycle Control},
author = {Niklas Persson and Feiran Zhao and Mojtaba Kaheni and Florian Dörfler and Alessandro V. Papadopoulos},
journal= {arXiv preprint arXiv:2502.13676},
year = {2025}
}