SOAR:基于状态空间模型和可编程梯度的航空航天图像中小目标检测的突破
计算机视觉与模式识别
2024-05-07 v2 人工智能
摘要
航空航天图像中的小目标检测在计算机视觉中面临着显著挑战,这源于小尺寸目标本身数据稀缺以及容易被更大目标和背景噪声遮挡的特性。而传统方法使用的基于Transformer的模型常因缺乏专业化数据库而受限,这会严重影响其在不同姿态和尺度下的目标检测性能。这凸显了需要更具适应性和轻量化模型的需求。为此,本文引入两种创新方法,显著提升了小航空目标的检测与分割能力。首先,我们探索在新引入的轻量级YOLO v9架构上应用SAHI框架,该架构利用可编程梯度信息(PGI)来减少序列特征提取过程中通常遇到的显著信息损失。本文采用Vision Mamba模型,该模型融合位置嵌入,以实现精确的位置感知视觉理解,并结合一种新型的双向状态空间模型(SSM),有效进行视觉上下文建模。该状态空间模型巧妙地融合了CNN的线性复杂度与Transformer的全局感受野,特别适用于遥感图像分类。我们的实验结果表明,检测准确率和处理效率均实现了显著提升,验证了这些方法在多样化航空场景中实现实时小目标检测的可行性。本文还讨论了这些方法可作为未来航空目标识别技术发展的基础模型。源代码将在此公开。
引用
@article{arxiv.2405.01699,
title = {SOAR: Advancements in Small Body Object Detection for Aerial Imagery Using State Space Models and Programmable Gradients},
author = {Tushar Verma and Jyotsna Singh and Yash Bhartari and Rishi Jarwal and Suraj Singh and Shubhkarman Singh},
journal= {arXiv preprint arXiv:2405.01699},
year = {2024}
}
备注
7 pages, 5 figures