面向带有负载臂的 UAV 基于 Transformer 的强化学习控制的元自适应光束搜索规划
机器人学
2026-03-30 v1
摘要
配备负载臂的无人机在检查、维护和基于接触的交互方面具有独特能力。然而,无人机及其负载臂的运动紧密耦合,即使因风或控制不完美而导致的姿态微小变化也会使末端执行器偏离其原本路径。这种耦合使得可靠跟踪困难,也限制了直接使用最初设计用于固定基座机器人的基于学习的机械臂控制器的应用。我们开发了基于 Transformer 的双深 Q 学习 (DDQN) 的强化学习框架,核心思想是使用自适应光束搜索规划器对候选控制序列进行短视程光束搜索,利用所学评论家作为前向估计器。这使得控制器能够通过仿真滚动预见末端执行器的运动,而不是直接在实际模型上执行这些动作,实现了软件在环 (SITL) 方法。该前瞻性规划依赖来自处理短状态序列的 Transformer 评论家的值估计,而 DDQN 主干提供维持学习过程稳定性所需的单步目标。实验在相同训练条件下的 3 自由度空中操作臂上进行,结果表明,所提出的元自适应规划器在奖励上提升了 10.2%,平均跟踪误差显著降低(从约 6% 降至 3%),在综合奖励-误差指标上提高了 29.6%。当无人机基座因外部扰动产生漂移时,我们的方法在保持 5 cm 跟踪误差的同时表现出更高的稳定性,优于固定光束和仅用 Transformer 的变体。
引用
@article{arxiv.2603.26612,
title = {Meta-Adaptive Beam Search Planning for Transformer-Based Reinforcement Learning Control of UAVs with Overhead Manipulators under Flight Disturbances},
author = {Hazim Alzorgan and Sayed Pedram Haeri Boroujeni and Abolfazl Razi},
journal= {arXiv preprint arXiv:2603.26612},
year = {2026}
}