低层特征至关重要:一种用于鲁棒多帧红外小目标检测的高效混合架构
计算机视觉与模式识别
2025-03-05 v1
摘要
多帧红外小目标检测(IRSTD)在低空和海上监控中发挥着至关重要的作用。结合 CNN 和 Transformer 的混合架构在提升多帧 IRSTD 性能方面展现出巨大潜力。在本文中,我们提出了 LVNet,这是一种简单而强大的混合架构,它重新定义了多帧 IRSTD 混合框架中的低层特征学习。我们的核心洞察是,Vision Transformers 中标准的线性 patch embedding 不足以捕获对红外小目标至关重要的尺度敏感局部特征。为了解决这一局限性,我们引入了一个多尺度 CNN 前端,通过利用卷积的局部空间偏置来显式建模局部特征。此外,我们设计了一个 U 型视频 Transformer 用于多帧时空上下文建模,有效捕获目标的运动特征。在公开数据集 IRDST 和 NUDT-MIRSDT 上的实验表明,LVNet 优于现有的 SOTA 方法。值得注意的是,与当前性能最佳的方法 LMAFormer 相比,LVNet 在 nIoU 上取得了 5.63% / 18.36% 的提升,同时仅使用了 1/221 的参数和 1/92 / 1/21 的计算成本。消融实验进一步验证了低层表征学习在混合架构中的重要性。我们的代码和训练好的模型可在 https://github.com/ZhihuaShen/LVNet 获取。
引用
@article{arxiv.2503.02220,
title = {Low-Level Matters: An Efficient Hybrid Architecture for Robust Multi-frame Infrared Small Target Detection},
author = {Zhihua Shen and Siyang Chen and Han Wang and Tongsu Zhang and Xiaohu Zhang and Xiangpeng Xu and Xia Yang},
journal= {arXiv preprint arXiv:2503.02220},
year = {2025}
}