基于 Concerto 强化学习的直驱双翼实验平台实时控制
机器学习
2025-02-18 v1 人工智能
机器人学
系统与控制
系统与控制
摘要
本文介绍了 CRL2RT 算法,这是一种旨在提高直驱双翼实验平台(DDTWEP)实时控制性能的高级强化学习方法。受蜻蜓飞行灵感启发,DDTWEP 的双翼结构导致非线性和不稳定的空气动力学相互作用,在俯仰、滚转和偏航机动期间引发复杂的负荷行为。这些复杂性对高频率(2000 Hz)下的稳定运动控制提出了挑战。为克服这些问题,我们开发了 CRL2RT 算法,该算法将经典控制元素与强化学习控制器结合使用,采用时间交错体系结构和基于规则的策略编制器。这种集成确保了有限时间收敛性和单次适应性。在包括不同振翅频率和偏航扰动等各种条件下的实验结果表明,CRL2RT 在标准 CPU 上实现的控制频率超过 2500 Hz。此外,当与经典控制器(如 PID、自适应 PID 和模型参考自适应控制(MRAC))集成时,CRL2RT 将跟踪性能提高 18.3%至 60.7%。这些发现表明 CRL2RT 在复杂实时控制场景中具有广泛适用性和优异性能,验证了其在克服现有控制策略局限性方面的有效性,推动了生物仿生空中载具的稳健、高效实时控制。
引用
@article{arxiv.2502.10429,
title = {Real Time Control of Tandem-Wing Experimental Platform Using Concerto Reinforcement Learning},
author = {Zhang Minghao and Yang Xiaojun and Wang Zhihe and Wang Liang},
journal= {arXiv preprint arXiv:2502.10429},
year = {2025}
}
备注
30 pages, 12 figures