中文

利用精选文本提示学习高光谱图像以实现高效多模态对齐

计算机视觉与模式识别 2025-09-30 v1 人工智能 机器学习

摘要

随着数据需求的不断增长,高效学习越来越依赖于精选和提炼高价值数据,而非粗暴地扩大模型规模。在高光谱图像 (HSI) 场景中,这一挑战被放大,因为其高维 3D 体素结构意味着每个空间位置都关联数百个连续光谱通道。虽然视觉和语言模型已针对自然图像或文本任务有效优化,但其在高光谱领域的跨模态对齐仍是开放且充实探索的问题。本文尝试通过利用 CLIP 风格的对比训练框架优化面向高光谱场景理解的视觉语言模型 (VLM)。我们的框架将视觉主干网络的体素级嵌入映射到冻结的大型嵌入模型 (LEM) 的潜在空间,其中可训练探针将视觉特征与模型文本标记表示对齐。两种模态通过限制在精选的硬负样本 (最近错误类别) 和半硬负样本 (随机干扰项) 上的对比损失进行对齐,同时包含正样本对。为进一步增强对齐,引入描述性提示编码类别语义,充当 HSI 嵌入的结构锚点。我们发现该方法仅更新了总参数的0.07%,即可实现最先进的性能。例如,在 Indian Pines (IP) 数据集上,模型相较于单模态和多模态基线实现了+0.92% 总体准确率 (OA) 和+1.60 Kappa (κ) 的提升;在 Pavia University (PU) 数据集上,分别实现了+0.69% OA 和+0.90 κ 的提升。此成果以参数集实现,约为 DCTN 的50倍且为 SS-TMNet 的90倍。

关键词

引用

@article{arxiv.2509.22697,
  title  = {Learning Hyperspectral Images with Curated Text Prompts for Efficient Multimodal Alignment},
  author = {Abhiroop Chatterjee and Susmita Ghosh},
  journal= {arXiv preprint arXiv:2509.22697},
  year   = {2025}
}

备注

Accepted at the IEEE/CVF International Conference on Computer Vision (ICCV 2025), Workshop on Curated Data for Efficient Learning