基于语言对齐特征的多光谱场景表示视觉语言框架
计算机视觉与模式识别
2025-01-20 v1
摘要
遥感场景理解通常面临为复杂环境(如各种土地利用区域或沿海地区)生成准确表示的挑战,这些环境可能还包括雪、云或雾。为此,我们提出了一种名为 Spectral LLaVA 的视觉语言框架,将多光谱数据与视觉语言对齐技术集成,以增强场景表示和描述。使用来自 Sentinel-2 的 BigEarthNet v2 数据集,我们采用基于 RGB 的场景描述建立了基线,并进一步通过融合多光谱信息证明了显著的改进。我们的框架针对对齐优化了一个轻量级线性投影层,同时保持 SpectralGPT 的视觉主干冻结。我们的实验涵盖使用线性探针进行场景分类以及用于联合执行场景分类和描述生成的语言建模。我们的结果突出了 Spectral LLaVA 在 RGB 数据alone 难以应对的情景下,能够产生详细且准确的描述,同时通过细化 SpectralGPT 的特征来实现语义有意义的表示,从而提升分类性能。
引用
@article{arxiv.2501.10144,
title = {A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features},
author = {Enes Karanfil and Nevrez Imamoglu and Erkut Erdem and Aykut Erdem},
journal= {arXiv preprint arXiv:2501.10144},
year = {2025}
}