探索细粒度图像-文本对齐用于指涉遥感图像分割
计算机视觉与模式识别
2024-12-30 v2
摘要
给定语言表达式,指涉遥感图像分割旨在识别地面对象并在图像中分配像素级标签。该任务的一个关键挑战是通过文本-图像对齐来捕获判别性的多模态特征。然而,现有的 RRSI 方法采用单一的粗糙对齐方式,即语言表达式被直接提取用于与视觉特征融合。本文认为,“细粒度图像-文本对齐”可以提高多模态信息的提取。为此,我们提出了一种新的指涉遥感图像分割方法,以充分利用视觉和语言表示。具体而言,原始指涉表达式被视为上下文文本,进一步分解为地面对象和空间位置文本。 proposed fine-grained image-text alignment 模块(FIAM)会同时利用输入图像的特征和相应文本的特征,获取更具判别性的多模态表征。同时,为处理遥感中地面对象的不同尺度,我们引入文本感知的多尺度增强模块(TMEM),用于自适应地进行跨尺度融合和交叉。我们在两个公开的指涉遥感数据集上评估了所提方法的有效性,包括 RefSegRS 和 RRSIS-D,结果表明该方法在多个最新方法上取得优异性能。代码将在 https://github.com/Shaosifan/FIANet 上公开。
引用
@article{arxiv.2409.13637,
title = {Exploring Fine-Grained Image-Text Alignment for Referring Remote Sensing Image Segmentation},
author = {Sen Lei and Xinyu Xiao and Tianlin Zhang and Heng-Chao Li and Zhenwei Shi and Qing Zhu},
journal= {arXiv preprint arXiv:2409.13637},
year = {2024}
}
备注
Accepted by IEEE TGRS