中文

视觉模态提示:适用于视觉语言目标检测器的适配方法

计算机视觉与模式识别 2025-03-18 v2 人工智能 机器学习

摘要

当目标检测器在不同模态(如红外和深度)上测试时,其零样态性能会下降。虽然最近的研究探索了图像翻译技术来适配检测器以适应新模态,但这些方法局限于单一模态且仅适用于传统检测器。最近的视觉语言检测器,如 YOLO-World 和 Grounding DINO,显示出具有前景的零样态能力,但尚未适配其他视觉模态。传统的微调方法会削弱检测器的零样态能力。而视觉语言模型常用的分类视觉提示策略对每个图像应用相同的线性提示翻译,效果有限。为此,我们提出了 ModPrompt—a 视觉提示策略,用于在不降低零样态性能的前提下适配视觉语言检测器以适应新模态。具体而言,我们提出了编码器-解码器视觉提示策略,并通过集成推理友好型模态提示解耦残差,进一步增强了适应性。经验基准测试结果表明,我们的方法在两种视觉语言检测器(YOLO-World 和 Grounding DINO)上实现了模态适配,涉及挑战性的红外(LLVIP、FLIR)和深度(NYUv2)数据集,性能相当于完全微调,同时保留了模型的零样态能力。代码已公开:https://github.com/heitorrapela/ModPrompt。

关键词

引用

@article{arxiv.2412.00622,
  title  = {Visual Modality Prompt for Adapting Vision-Language Object Detectors},
  author = {Heitor R. Medeiros and Atif Belal and Srikanth Muralidharan and Eric Granger and Marco Pedersoli},
  journal= {arXiv preprint arXiv:2412.00622},
  year   = {2025}
}