基于VLMs和双交叉注意力网络的多模态遥感场景分类
计算机视觉与模式识别
2024-12-04 v1
摘要
遥感场景分类(RSSC)是具有多种应用场景的关键任务,涉及土地利用和资源管理。虽然单模态图像方法显示出前景,但常面临高类内差异和类间相似性等局限性。将文本信息纳入分类中可通过提供额外的上下文和语义理解来增强分类,但手动文本标注工作量大且成本高昂。本文提出了一种新型RSSC框架,将由大规模视觉语言模型(VLMs)生成的文本描述作为辅助模态,无需高昂的手动标注成本。为充分利用视觉和文本数据之间的潜在互补性,我们提出了一种基于双交叉注意力的网络来融合这些模态以生成统一的表示。在五个RSSC数据集上进行的大量定量和定性实验表明,我们的框架 consistently优于基线模型。我们还验证了VLM生成的文本描述相对于人工标注文本描述的有效性。此外,我们设计了一种零样本分类场景,以显示所学的多模态表示可有效用于未见类别的分类。该研究为在RSSC任务中利用文本信息开辟了新的机会,并提供了一种有前景的多模态融合结构,为未来研究提供了启发和灵感。代码可在 https://github.com/CJR7/MultiAtt-RSSC 查阅。
引用
@article{arxiv.2412.02531,
title = {Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks},
author = {Jinjin Cai and Kexin Meng and Baijian Yang and Gang Shao},
journal= {arXiv preprint arXiv:2412.02531},
year = {2024}
}