中文

面向 MSTAR 自动目标识别的大型语言-视觉问答模型

计算机视觉与模式识别 2026-05-12 v1 人工智能 图像与视频处理

摘要

大型语言-视觉模型(LLVM)如 OpenAI 的 ChatGPT 和 GPT-4 已成为分析文本和图像的强大工具。这种数据域的融合代表着重大的范式转变,对自动目标识别(ATR)产生深远影响。最近的基于变换器的 LLVM 研究在地理空间感知任务方面取得了显著的改进。我们的研究考察了将 LLVM 应用于遥感图像描述生成和视觉问答(VQA),具体聚焦于合成孔径雷达(SAR)图像。我们审查了最新的 LLVM 方法,包括 CLIP 和 LLaVA 神经网络变换器架构。我们开发了一个来源于 MSTAR 公开数据集的 SAR 训练和评估基准,扩展后包括描述性文本标题和用于 VQA 任务的问答对。这个挑战数据集旨在推动 LLVM 在识别 SAR 图像中细粒度 ATR 细节方面的能力。通过参数高效微调,我们训练了一个 LLVM 方法,在 98% 的准确率下识别细粒度目标属性。我们详细说明了数据设置和实验,阐述了可能导致误导性结论的潜在陷阱。准确识别和区分 SAR 数据中的军事车辆类型是关键挑战,尤其是在复杂环境条件下。掌握这一目标识别技能可能需要分析员数月的训练和数年的练习。该研究代表了将 LLVM 应用于 SAR 应用的独一无二的努力,推动了面向军事和情报情报背景的遥感 ATR 的机器辅助发展。

关键词

引用

@article{arxiv.2605.10772,
  title  = {Towards a Large Language-Vision Question Answering Model for MSTAR Automatic Target Recognition},
  author = {David F. Ramirez and Tim L. Overman and Kristen Jaskie and Marv Kleine and Andreas Spanias},
  journal= {arXiv preprint arXiv:2605.10772},
  year   = {2026}
}

备注

Accepted to SPIE Defense + Commercial Sensing, Automatic Target Recognition XXXV