基于规则的目标导向强化学习在受限仿真训练下的搜救无人机任务高级指导
机器人学
2026-04-30 v1 人工智能
机器学习
摘要
本文提出了一种用于无人机(UAV)搜救(SAR)场景下的层次化决策框架,该场景受限于仿真训练。该框架将固定的基于规则的高级指导器与在线目标条件低级强化学习(RL)控制器相结合。为检验早期适应性,我们还考虑了严格的无预训练部署 regime。高级指导器在结构化任务规范下离线定义并编译为确定性规则,提供可解释的任务和安全感知指导,包括推荐动作、规避动作以及制度相关的仲裁权重。低级控制器通过任务定义的稠密奖励在线学习,并通过一种结合规则派生元数据的模式感知优先级回放机制来重用经验。我们在两个任务上进行评估:电池感知的多目标投递和动态目标投递于障碍丰富的环境中。在两个任务中,所提出的方法主要通过减少碰撞终止,提高了早期安全性和样本效率,同时保持了对场景特定动态的在线适应能力。
引用
@article{arxiv.2604.26833,
title = {Rule-based High-Level Coaching for Goal-Conditioned Reinforcement Learning in Search-and-Rescue UAV Missions Under Limited-Simulation Training},
author = {Mahya Ramezani and Holger Voos},
journal= {arXiv preprint arXiv:2604.26833},
year = {2026}
}