CADFormer:用于指代遥感图像分割的细粒度跨模态对齐与解码 Transformer
计算机视觉与模式识别
2025-04-01 v1
摘要
指代遥感图像分割(Referring Remote Sensing Image Segmentation, RRSIS)是一项具有挑战性的任务,旨在根据给定的语言表达在遥感(RS)图像中分割出特定的目标物体。现有的 RRSIS 方法通常采用粗粒度的单向对齐方式来获取多模态特征,并且往往忽略了语言特征在解码过程中作为上下文信息的关键作用。因此,这些方法在视觉与语言特征之间表现出较弱的物体级对应关系,导致预测掩膜不完整或出现错误,尤其是在处理复杂表达和精细的遥感图像场景时。为了应对这些挑战,我们提出了用于 RRSIS 的细粒度跨模态对齐与解码 Transformer——CADFormer。具体而言,我们设计了语义互引导对齐模块(SMGAM),以同时实现视觉到语言和语言到视觉的对齐,从而实现视觉与文本特征的全面融合,完成细粒度的跨模态对齐。此外,我们引入了文本增强跨模态解码器(TCMD),在解码过程中融入语言特征,使用精炼后的文本信息作为上下文来增强跨模态特征之间的关系。为了全面评估 CADFormer 的性能,尤其是在复杂场景中对不明显目标的分割能力,我们构建了一个新的 RRSIS 数据集,称为 RRSIS-HR,其中包含更大的高分辨率遥感图像块以及语义更丰富的语言表达。在 RRSIS-HR 数据集和流行的 RRSIS-D 数据集上进行的大量实验证明了 CADFormer 的有效性和优越性。数据集和源代码将在 https://github.com/zxk688 提供。
引用
@article{arxiv.2503.23456,
title = {CADFormer: Fine-Grained Cross-modal Alignment and Decoding Transformer for Referring Remote Sensing Image Segmentation},
author = {Maofu Liu and Xin Jiang and Xiaokang Zhang},
journal= {arXiv preprint arXiv:2503.23456},
year = {2025}
}