基于奖励设计与终止条件的 RL 四旋翼控制性能调优的启发式方法
机器人学
2026-05-20 v1 机器学习
最优化与控制
摘要
强化学习(RL)基于的四旋翼控制策略在快速导航拥挤环境和无人机赛跑等任务中取得了令人印象的性能,其关注点在于速度和灵活性。然而,在某些应用中,如基础设施检查,关键是实现精确、受控的机动动作,以可调的性能为目标。本文提出了一种新颖的启发式方法,通过奖励设计和终止条件实现可调的 RL 四旋翼控制性能。我们提出了包含双带宽指数函数的新颖奖励结构,实现基本临界阻尼响应的 setpoint 跟踪,同时实现低稳态误差。配合 Proximal Policy Optimization(PPO)算法,结合剧情截断条件,可在 600 万时间步内以样本高效的方式实现预期性能。为围绕基线行为进行性能调优,我们提出了直观的启发式规则,用于调整奖励权重和指数系数,以实现更快(类似体操)和更慢(类似检查)的稳定时间性能,同时保持基线临界阻尼响应和约 2% 的稳态误差。我们在 100 次试验中评估了三个 RL 策略(基线、体操式和检查式),并在随机初始条件下展示了位置和偏航跟踪中准确且可调的性能,从而证明了所提出启发式方法的有效性。
引用
@article{arxiv.2605.19166,
title = {A Heuristic Approach for Performance Tuning in RL-based Quadrotor Control via Reward Design and Termination Conditions},
author = {Fausto Mauricio Lagos Suarez and Akshit Saradagi and Vidya Sumathy and George Nikolakopoulos},
journal= {arXiv preprint arXiv:2605.19166},
year = {2026}
}
备注
Accepted in the 34th Mediterranean Conference on Control and Automation