基于图的无对齐 UAV RGBT 图像语义校准网络及大规模基准
计算机视觉与模式识别
2026-05-05 v2
摘要
精细化 RGBT 图像语义分割对于无人机 (UAV) 全天候场景理解至关重要。然而,UAV RGBT 图像语义分割面临两个相互耦合的挑战:由传感器视差和平台振动引起的跨模态空间错位,以及在俯视航空视角下对细粒度地面目标的严重语义混淆。为此,我们提出了用于无对齐 UAV RGBT 图像语义分割的基于图的语义校准网络 (GSCNet)。具体而言,我们设计了特征解耦和对齐模块 (FDAM),将每个模态解耦为共享结构和私有感知组件,并在共享子空间中执行可变形对齐,以实现减少模态外观干扰的稳健空间校正。此外,我们提出了语义图校准模块 (SGCM),该模块将 UAV 场景中地面目标类别的层次分类别和共现规律显式编码为结构化类别图,并将这些先验信息纳入图注意力推理,以校准视觉相似和稀有类别的预测。此外,我们构建了 Unaligned RGB-Thermal Fine-grained (URTF) 基准,据称是目前规模最大、最细粒度的无对齐 UAV RGBT 图像语义分割基准,包含超过 25,000 对图像,涵盖 61 个语义类别,具有真实的跨模态错位。URTF 上的大量实验表明,GSCNet 在状态方法上显著优于,尤其在细粒度类别上取得显著提升。该数据集可在 https://github.com/mmic-lcl/Datasets-and-benchmark-code 获得。
引用
@article{arxiv.2604.26893,
title = {Graph-based Semantic Calibration Network for Unaligned UAV RGBT Image Semantic Segmentation and A Large-scale Benchmark},
author = {Fangqiang Fan and Zhicheng Zhao and Xiaoliang Ma and Chenglong Li and Jin Tang},
journal= {arXiv preprint arXiv:2604.26893},
year = {2026}
}
备注
13 pages,13 figures