基于语义搜索、检索和 MLLM 生成的 SAR-RAG:用于合成孔径雷达图像的自动目标识别
计算机视觉与模式识别
2026-05-12 v2 人工智能
图像与视频处理
摘要
我们提出了一种用于自动目标识别 (ATR) 的视觉上下文图像检索增强生成 (ImageRAG) AI 代理,用于处理合成孔径雷达 (SAR) 图像。SAR 是一种用于防御和安保应用中检测和监视军事车辆位置的遥感方法,这些车辆在图像中可能难以区分。研究人员广泛研究了 SAR ATR 以提高对车辆类型、特征和测量值的区分和识别能力。通过将测试实例与已知车辆目标类型进行比较,可改进识别任务。新方法提升了神经网络、transformer 注意力和多模态大语言模型 (MLLM) 的能力。可以开发一种利用一组工具的 agentic AI 方法,例如通过已知相似示例的库中进行搜索。我们提出的方法是 SAR 检索增强生成 (SAR-RAG),将多模态大语言模型 (MLLM) 与语义嵌入向量数据库相结合,以支持具有已知特征的图像 exemplar 的上下文搜索。通过恢复已知真实目标类型的过去图像示例,SAR-RAG 系统可比较相似车辆类别,从而提高 ATR 预测准确性。我们通过搜索和检索指标、类别分类准确性以及车辆尺寸的数值回归进行评估。所有指标在将 SAR-RAG 添加到 MLLM 基线方法作为附加 ATR 记忆库时均显示出改进。
引用
@article{arxiv.2602.04712,
title = {SAR-RAG: ATR Visual Question Answering by Semantic Search, Retrieval, and MLLM Generation},
author = {David F. Ramirez and Tim Overman and Kristen Jaskie and Joe Marvin and Andreas Spanias},
journal= {arXiv preprint arXiv:2602.04712},
year = {2026}
}
备注
Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI