SegFly:面向大规模无人机 RGB-热语义分割的 2D-3D-2D 范式
计算机视觉与模式识别
2026-03-19 v1
摘要
无人机(UAV)的语义分割是无人机 aerial 场景理解的基础,但现有的 RGB 和 RGB-T 数据集在规模、多样性和标注效率方面受限,主要源于手动标注成本高且在廉价无人机上实现精确的 RGB-T 对齐困难。为此,我们提出一种可扩展的几何驱动 2D-3D-2D 范式,利用高重叠 aerial 图像中的多视图冗余性,自动将小部分手动标注的 RGB 图像的标签传递到两种模态(RGB 和热)的统一框架中。通过将少于 3% 的 RGB 图像升格为语义 3D 点云,并重新投影到所有视图,我们的 approach 能够在大型图像集合上实现稠密伪 ground-truth 生成,自动生成 97% 的 RGB 标签和 100% 的热标签,同时在无任何 2D 手动细化的情况下实现 91% 和 88% 的标注准确率。我们进一步将这种 2D-3D-2D 范式扩展到跨模态图像配准,使用 3D 几何作为中间对齐空间,实现完全自动、强的像素级 RGB-T 对齐,达到 87% 的配准准确率且无需硬件级同步。将我们的框架应用于现有的 geo-referenced aerial 图像,我们构建了 SegFly,一个包含 20,000 多张高分辨率 RGB 图像和 15,000 多对几何对齐的 RGB-T 配对的大规模基准数据集,涵盖多种城市、工业和农村环境,以及多个海拔和季节。在 SegFly 上,我们建立了 Firefly 基线,用于 RGB 和热语义分割,表明常规架构和视觉基础模型均从 SegFly 监督中受益良多,凸显了几何驱动 2D-3D-2D 流水线在可扩展多模态场景理解中的潜力。数据与代码已公开:https://github.com/markus-42/SegFly。
引用
@article{arxiv.2603.17920,
title = {SegFly: A 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale},
author = {Markus Gross and Sai Bharadhwaj Matha and Rui Song and Viswanathan Muthuveerappan and Conrad Christoph and Julius Huber and Daniel Cremers},
journal= {arXiv preprint arXiv:2603.17920},
year = {2026}
}