基于在线策略优化的机器人控制器快速非剧情式自适应调谐
机器人学
2025-07-16 v1 系统与控制
系统与控制
摘要
我们研究了在动力学、策略类别和最优性目标均为时间可变的 setting 下,对机器人控制器参数进行在线调谐的在线算法。该系统遵循单一轨迹,无剧情或状态重置,时间可变信息不可提前知晓。我们聚焦于非线性几何四旋翼机控制器作为测试案例,提出了单轨迹基于模型的在线策略优化算法 M-GAPS 的实际实现,以及四旋翼机状态空间和策略类的重新参数化,以改进优化景观。在硬件实验中,我们将其与施加人工剧情的基于模型和无模型基线进行比较。我们表明 M-GAPS 更快地找到近最优参数,尤其当剧情长度不利时。我们还表明 M-GAPS 能快速适应重大未建模风和有效负载扰动,并在 1:6 比例的阿切尔曼转向汽车上实现类似的显著改进。我们的结果表明这类在线策略优化在硬件上的实用性,显著比经典自适应控制更灵活,比无模型强化学习更稳定和数据高效。
引用
@article{arxiv.2507.10914,
title = {Fast Non-Episodic Adaptive Tuning of Robot Controllers with Online Policy Optimization},
author = {James A. Preiss and Fengze Xie and Yiheng Lin and Adam Wierman and Yisong Yue},
journal= {arXiv preprint arXiv:2507.10914},
year = {2025}
}
备注
11 pages, 9 figures