面向稠密 SAR 目标检测的 DenSe-AdViT:一种新型视觉变换器
计算机视觉与模式识别
2025-12-22 v1
摘要
视觉变换器(Vision Transformer, ViT)因其卓越的全局特征提取能力,在合成孔径雷达(SAR)图像目标检测中取得了显著成绩,但在提取多尺度局部特征方面存在困难,导致在检测稀疏小目标时性能受限。为此,本文提出了一种用于稠密 SAR 目标检测的密度感知视觉变换器,名为自适应标记 DenSe-AdViT(Density-Sensitive Vision Transformer with Adaptive Tokens)。我们设计了密度感知模块(Density-Aware Module, DAM)作为初始组件,基于目标分布生成密度张量。该模块由精心构建的目标度量指标指引,实现对目标空间分布和密度的精准高效捕获。为将由卷积神经网络(CNN)增强的多尺度信息与来自变换器的全局特征相结合,提出了密度增强融合模块(Density-Enhanced Fusion Module, DEFM)。DEFM 利用密度掩码及多源特征,有效地引导注意力聚焦于目标存活区域。值得注意的是,我们的 DenSe-AdViT 在 RSDD 数据集上实现了79.8%的平均精度(mAP),在 SIVED 数据集上实现了92.5%的 mAP,两者均特征大量稠密分布的车辆目标。
引用
@article{arxiv.2504.13638,
title = {DenSe-AdViT: A novel Vision Transformer for Dense SAR Object Detection},
author = {Yang Zhang and Jingyi Cao and Yanan You and Yuanyuan Qiao},
journal= {arXiv preprint arXiv:2504.13638},
year = {2025}
}