面向自然语言引导的无人机:基于空间关系匹配的 GeoText-1652 基准
计算机视觉与模式识别
2024-08-01 v4 多媒体
摘要
由于可获取的多模态数据集匮乏以及视觉与文本数据对齐的严苛精度要求,通过自然语言指令导航无人机仍然具有挑战性。为满足这一迫切需求,我们引入了 GeoText-1652,一个新的自然语言引导的地理定位基准。该数据集通过交互式人机流程系统构建,利用大语言模型(LLM)驱动的标注技术与预训练视觉模型相结合。GeoText-1652 以空间感知的文本标注扩展了已有的 University-1652 图像数据集,从而在图像、文本与边界框元素之间建立了一一对应关系。我们进一步引入了一种新的优化目标,称为混合空间匹配,以利用细粒度空间关联进行区域级空间关系匹配。大量实验表明,与其他主流跨模态方法相比,我们的方法保持了具有竞争力的召回率。这凸显了我们的方法通过在实际场景中无缝集成自然语言指令来提升无人机控制与导航的广阔潜力。
引用
@article{arxiv.2311.12751,
title = {Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching},
author = {Meng Chu and Zhedong Zheng and Wei Ji and Tingyu Wang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2311.12751},
year = {2024}
}
备注
Accepted by ECCV 2024