UEMM-Air: 使无人机执行更多多模态任务
计算机视觉与模式识别
2025-02-14 v3
摘要
无人机多模态学习的发展通常依赖于大量像素对齐的多模态图像数据。然而,现有的数据集面临着模态有限、构建成本高和标注不精确等挑战。为此,我们提出了一种合成的基于无人机的多模态多任务数据集 UEMM-Air。具体而言,我们使用 Unreal Engine (UE) 模拟了各种无人机飞行场景和物体类型。然后,我们设计了无人机的飞行逻辑,以自动从不同场景、视角和高度收集数据。此外,我们提出了一种新颖的启发式自动标注算法来生成准确的物体检测标签。最后,我们利用标签生成图像的文本描述,以使我们的 UEMM-Air 支持更多的跨模态任务。我们的 UEMM-Air 总共包含 12 万对具有 6 种模态和精确标注的图像。此外,我们进行了大量实验,并在我们的数据集上建立了新的基准结果。我们还发现,与其他类似数据集相比,在 UEMM-Air 上预训练的模型在下游任务中表现出更好的性能。该数据集是公开可用的 (https://github.com/1e12Leon/UEMM-Air),以支持无人机多模态任务的研究。
引用
@article{arxiv.2406.06230,
title = {UEMM-Air: Make Unmanned Aerial Vehicles Perform More Multi-modal Tasks},
author = {Liang Yao and Fan Liu and Shengxiang Xu and Chuanyi Zhang and Xing Ma and Jianyu Jiang and Zequan Wang and Shimin Di and Jun Zhou},
journal= {arXiv preprint arXiv:2406.06230},
year = {2025}
}