中文

SAR船舶视觉问答方法:突破多模态数据集构建与模型微调的需求

计算机视觉与模式识别 2024-11-05 v1

摘要

当前的视觉问答(VQA)任务通常需要构建多模态数据集并对视觉语言模型进行微调,这需要大量时间和资源。这极大地阻碍了VQA在下游任务中的应用,例如基于合成孔径雷达(SAR)图像的船舶信息分析。为应对这一挑战,本文提出了一种新颖的VQA方法,将目标检测网络与视觉语言模型集成,专门用于分析SAR图像中的船舶。这种集成旨在增强VQA系统的能力,聚焦于船舶位置、密度和尺寸分析以及风险行为检测等方面。最初,我们在两个代表性SAR船舶检测数据集SSDD和HRSID上使用YOLO网络进行了基线实验,以评估每个模型在检测精度方面的表现。基于这些结果,我们选择了最优模型YOLOv8n作为最适合该任务的目标检测网络。随后,利用视觉语言模型Qwen2-VL,我们为SAR场景设计并实现了一个VQA任务。该任务利用检测网络输出的船舶位置和尺寸信息,为SAR图像生成多轮对话和场景描述。实验结果表明,该方法不仅无需额外数据集或微调即可实现基础的SAR场景问答,还能动态适应复杂的多轮对话需求,展现出稳健的语义理解和适应性。

关键词

引用

@article{arxiv.2411.01445,
  title  = {A Visual Question Answering Method for SAR Ship: Breaking the Requirement for Multimodal Dataset Construction and Model Fine-Tuning},
  author = {Fei Wang and Chengcheng Chen and Hongyu Chen and Yugang Chang and Weiming Zeng},
  journal= {arXiv preprint arXiv:2411.01445},
  year   = {2024}
}