VLN-Pilot:大型视觉语言模型作为自主室内无人机操作员
机器人学
2026-02-06 v1 计算机视觉与模式识别
摘要
本文介绍 VLN-Pilot,一种 novel 框架,其中大型视觉语言模型 (VLLM) 扮演室内无人机导航的人类飞行员。通过利用 VLLM 的多模态推理能力,VLN-Pilot 解释自由形式的自然语言指令,并将其在视觉观察中对齐,以规划和执行无人机轨迹于 GPS 禁区的室内环境。不同于传统基于规则或几何的路径规划方法,我们的框架整合了语言驱动的语义理解与视觉感知,实现情境感知的高级飞行行为,所需的任务特定工程最小化。VLN-Pilot 支持无人机完全自主的指令跟随,通过推理空间关系、障碍规避和对突发事件的动态反应。我们在自定义的逼真室内模拟基准上进行了验证,表明 VLLM 驱动的智能体可在包含多个语义目标的长程导航等复杂指令跟随任务上实现高成功率。实验结果凸显了以语言引导的自主智能体取代遥控无人机飞行员的潜力,为规模化、人性化的室内无人机控制开辟了新途径,适用于检查、搜救和设施监控等任务。我们的结果表明,基于 VLLM 的飞行员可能显著降低操作员的工作负担,同时在受限的室内环境中提高安全性和任务灵活性。
引用
@article{arxiv.2602.05552,
title = {VLN-Pilot: Large Vision-Language Model as an Autonomous Indoor Drone Operator},
author = {Bessie Dominguez-Dager and Sergio Suescun-Ferrandiz and Felix Escalona and Francisco Gomez-Donoso and Miguel Cazorla},
journal= {arXiv preprint arXiv:2602.05552},
year = {2026}
}