IndoorUAV:面向连续室内环境的视觉语言无人机导航基准
机器人学
2025-12-23 v1 人工智能
摘要
视觉语言导航(VLN)使代理能够通过跟随基于视觉观察的自然语言指令来在复杂环境中导航。尽管大多数现有工作聚焦于地面机器人或户外无人机,但针对室内无人机的VLN仍鲜有探索,尽管其对实际应用(如在受限空间内的检查、投递和搜救)具有重要意义。为填补这一空白,我们引入了IndoorUAV,一个专为室内无人机VLN设计的新型基准和方法。我们首先从Habitat模拟器中精选了超过1,000个多样且结构丰富的3D室内场景。在这些环境中,我们模拟现实的无人机飞行动力学,以收集多样化的3D导航轨迹,并通过数据增强技术进一步丰富。此外,我们设计了一个自动注释管道,用于为每个轨迹生成粗粒度和细粒度的自然语言指令。这一过程产生了超过16,000条高质量的轨迹,其中包括面向长程VLN的IndoorUAV-VLN子集。为支持短程规划,我们通过选择语义关键帧并生成简洁指令,将长轨迹分割为子轨迹,形成IndoorUAV-VLA子集。最后,我们引入IndoorUAV-Agent,一个专为本基准设计的新型导航模型,利用任务分解和多模态推理。我们希望IndoorUAV能为推动室内航空导航领域的视觉语言具身人工智能研究提供宝贵资源。
关键词
引用
@article{arxiv.2512.19024,
title = {IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments},
author = {Xu Liu and Yu Liu and Hanshuo Qiu and Yang Qirong and Zhouhui Lian},
journal= {arXiv preprint arXiv:2512.19024},
year = {2025}
}