FlightGPT:面向UAV视觉语言导航的通用性与可解释性
计算与语言
2025-05-20 v1 计算机视觉与模式识别
摘要
无人机(UAV)视觉语言导航(VLN)对于灾后救援、物流投递和城市检查等应用至关重要。然而,现有方法常面临多模态融合不足、泛化性弱和可解释性差等挑战。为此,我们提出了FlightGPT框架,基于视觉语言模型(VLM)构建,具备强大的多模态感知能力。我们设计了两阶段训练流程:首先使用高质量演示进行监督微调(SFT),以提高初始化和结构化推理;随后采用组相对策略优化(GRPO)算法,结合综合奖励(考虑目标精度、推理质量和格式合规性),增强泛化性和适应性。此外,FlightGPT引入基于链式思维(CoT)的推理机制,以提高决策可解释性。在city-scale数据集CityNav上进行大量实验表明,FlightGPT在所有场景中均实现最佳性能,净超过最强基线测试环境中成功率提升9.22%。我们的实现已公开。
引用
@article{arxiv.2505.12835,
title = {FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models},
author = {Hengxing Cai and Jinhan Dong and Jingjun Tan and Jingcheng Deng and Sihang Li and Zhifeng Gao and Haidong Wang and Zicheng Su and Agachai Sumalee and Renxin Zhong},
journal= {arXiv preprint arXiv:2505.12835},
year = {2025}
}