面向遥感图像描述的自举交互式图文对齐
计算机视觉与模式识别
2023-12-05 v1
摘要
近年来,遥感图像描述在遥感领域引起了广泛关注。由于遥感图像在空间分辨率上的显著差异,该领域现有方法主要集中在遥感图像特征的细粒度提取上,但无法有效处理视觉特征与文本特征之间的语义一致性。为了高效对齐图文,我们提出了一种新颖的基于两阶段视觉-语言预训练的方法,以自举遥感图像描述的交互式图文对齐,称为 BITA,该方法依赖于轻量级交互式 Fourier Transformer 的设计,以更好地对齐遥感图文特征。交互式 Fourier Transformer 中的 Fourier 层能够在频域中提取遥感图像的多尺度特征,从而减少遥感视觉特征的冗余。具体而言,第一阶段通过图文对比学习进行初步对齐,将交互式 Fourier Transformer 学习到的多尺度遥感特征与文本特征对齐。在第二阶段,交互式 Fourier Transformer 将冻结的图像编码器与大语言模型连接。随后,利用前缀因果语言建模,使用视觉特征引导文本生成过程。最终,在 UCM-caption、RSICD 和 NWPU-caption 数据集上,实验结果清楚地表明 BITA 优于其他先进的对比方法。代码可在 https://github.com/yangcong356/BITA 获取。
引用
@article{arxiv.2312.01191,
title = {Bootstrapping Interactive Image-Text Alignment for Remote Sensing Image Captioning},
author = {Cong Yang and Zuchao Li and Lefei Zhang},
journal= {arXiv preprint arXiv:2312.01191},
year = {2023}
}