从文字到波长:基于视觉语言模型的少样本多光谱目标检测
计算机视觉与模式识别
2025-12-19 v1
摘要
多光谱目标检测对于自动驾驶和监视等安全敏感应用至关重要,在多样化的照明条件下需要鲁棒的感知能力。然而,标注的多光谱数据稀缺 severely 限制了深度检测器的训练。在数据稀缺的场景中,文本类别信息可作为有价值的语义监督来源。针对近年视觉语言模型(Vision-Language Models, VLMs)在计算机视觉中的成功,我们探索其在少样本多光谱目标检测中的潜力。具体而言,我们调整了两种代表性的 VLM 基于检测器,Grounding DINO 和 YOLO-World,以处理多光谱输入,并提出一种有效的机制将文本、视觉和热力学模态集成。通过在两个流行的多光谱图像基准数据集(FLIR 和 M3FD)上的大量实验,我们展示 VLM 基于的检测器不仅在少样本情景中卓越,显著优于使用相同数据量训练的专用多光谱模型,还在完全监督设置下实现竞争或更好的结果。我们的发现表明,大规模 VLMs 所学习的语义先验有效地传递到未见的光谱模态,为数据高效的多光谱感知提供了强大的路径。
引用
@article{arxiv.2512.15971,
title = {From Words to Wavelengths: VLMs for Few-Shot Multispectral Object Detection},
author = {Manuel Nkegoum and Minh-Tan Pham and Élisa Fromont and Bruno Avignon and Sébastien Lefèvre},
journal= {arXiv preprint arXiv:2512.15971},
year = {2025}
}