CityNav:面向真实航空导航的大规模数据集
计算机视觉与模式识别
2025-08-05 v3 人工智能
摘要
视觉语言导航(VLN)旨在开发能够在真实环境中导航的智能体。尽管最近的跨模态训练方法在室内和户外场景中显著提高了导航性能,但由于数据集有限以及难以整合视觉与地理信息,航空城市导航仍得到很少关注。为填补这一空白,我们引入CityNav,这是第一个面向真实航空VLN的大规模数据集。该数据集由32,637组人类演示轨迹组成,每组轨迹配有自然语言描述,覆盖面积为4.65平方公里的两个真实城市:剑桥和伯明翰。与由合成场景组成的数据集(如AerialVLN)不同,CityNav数据集具有独特挑战:智能体必须解释真实世界地标与导航目的之间的空间关系,使CityNav成为推动航空VLN发展的必需基准。此外,作为应对这一挑战的初始步骤,我们提供了创建地理语义地图的方法,可作为导航期间的辅助模态输入。我们的实验中,我们比较了三个具有代表性的航空VLN智能体(Seq2seq、CMA和AerialVLN模型),并表明语义地图表示显著提高了它们的导航性能。
引用
@article{arxiv.2406.14240,
title = {CityNav: A Large-Scale Dataset for Real-World Aerial Navigation},
author = {Jungdae Lee and Taiki Miyanishi and Shuhei Kurita and Koya Sakamoto and Daichi Azuma and Yutaka Matsuo and Nakamasa Inoue},
journal= {arXiv preprint arXiv:2406.14240},
year = {2025}
}
备注
ICCV2025. The first two authors are equally contributed. Project page: https://water-cookie.github.io/city-nav-proj/