基于强化学习的受限空间内自主无人机飞行导航
机器人学
2025-12-19 v2 人工智能
机器学习
系统与控制
系统与控制
摘要
自主无人机对受限的工业设施进行巡检(如通风管道)要求具备稳健的导航策略,因而碰撞不可接受。尽管深度强化学习 (Deep Reinforcement Learning, DRL) 为开发此类策略提供了强大的范畴,但它在基于策略的方法与基于采样的方法之间呈现出关键的权衡。基于采样的方法在样本效率方面具有优势,这对于最小化昂贵且不安全的实际微调至关重要;而基于策略的方法往往表现出更大的训练稳定性,这对于在危险密集的环境中实现可靠收敛至关重要。本文通过比较领先的基于策略算法——最近策略优化 (Proximal Policy Optimization, PPO)——与基于采样的对手算法——柔软演员-评论家 (Soft Actor-Critic, SAC)——来直接探讨这一权衡,针对在高保真模拟器中生成的管道内的精确飞行进行测试。我们的结果显示,PPO 持续学习到稳定、无碰撞的策略,使其完成整个课程;而 SAC 则未能找到完整解决方案,收敛到次优策略,仅能导航初始段后失败。本工作提供了证据表明,对于高精度、安全关键的导航任务,成熟的基于策略方法的可靠收敛优于基于采样方法的名义样本效率。
引用
@article{arxiv.2508.16807,
title = {Autonomous UAV Flight Navigation in Confined Spaces: A Reinforcement Learning Approach},
author = {Marco S. Tayar and Lucas K. de Oliveira and Felipe Andrade G. Tommaselli and Juliano D. Negri and Thiago H. Segreto and Ricardo V. Godoy and Marcelo Becker},
journal= {arXiv preprint arXiv:2508.16807},
year = {2025}
}