将合成孔径雷达目标识别重新框定为视觉推理:基于多模态大语言模型的链式思考数据集
信号处理
2025-07-15 v1
摘要
在合成孔径雷达(SAR)图像识别的语境中,传统方法常因SAR数据的内在局限性(如弱纹理、高噪声和模糊对象边界)而难以胜任。本文探索了一种新颖视角,通过将SAR目标识别重新定义为多模态推理任务。我们利用多模态大语言模型(Multimodal Large Language Models, MLLMs),具体采用GPT-4o,基于SAR图像进行目标分类,同时引导候选类别并通过链式思考(Chain-of-Thought, CoT)增强推理。构建了一个新的数据集,基于FAIR-CSAR基准,包含原始SAR图像、结构化目标标注、候选标签集合以及GPT生成的CoT推理链。实验结果表明,MLLMs在大多数情景下能够生成逻辑连贯且可解释的推断。我们的分析揭示了MLLMs在解释SAR图像方面的优势与当前局限,并通过错误案例分析提供了关于模型行为的详细洞见。这一工作表明将MLLMs纳入SAR分析管道的可行性,并为未来的SAR导向视觉推理研究奠定了基础。
引用
@article{arxiv.2507.09535,
title = {Reframing SAR Target Recognition as Visual Reasoning: A Chain-of-Thought Dataset with Multimodal LLMs},
author = {Chaoran Li and Xingguo Xu and Siyuan Mu},
journal= {arXiv preprint arXiv:2507.09535},
year = {2025}
}