中文

Text-IRSTD:利用语义文本促进复杂场景中的红外小目标检测

计算机视觉与模式识别 2025-03-11 v1

摘要

红外小目标检测目前是计算机视觉中一项热门且具挑战性的任务。现有方法通常侧重于挖掘目标的视觉特征,难以应对复杂多样的检测场景。其主要原因在于红外小目标自身的图像信息有限,因此仅依靠视觉特征无法区分目标与干扰,导致检测性能下降。为了解决这一问题,我们引入了一种利用语义文本指导红外小目标检测的新方法,称为 Text-IRSTD。该方法创新性地将经典的 IRSTD 扩展为文本引导的 IRSTD,提供了一种新的研究思路。一方面,我们设计了一种新颖的模糊语义文本提示,以适应模糊的目标类别。另一方面,我们提出了一种渐进式跨模态语义交互解码器(PCSID),以促进文本与图像之间的信息融合。此外,我们构建了一个新的基准数据集,包含 2,755 张不同场景的红外图像并带有模糊语义文本标注,称为 FZDT。大量实验结果表明,与 state-of-the-art 方法相比,我们的方法取得了更好的检测性能和目标轮廓恢复效果。此外,所提出的 Text-IRSTD 在未见检测场景中展现出强大的泛化能力和广阔的应用前景。本文被接收后,数据集和代码将公开发布。

关键词

引用

@article{arxiv.2503.07249,
  title  = {Text-IRSTD: Leveraging Semantic Text to Promote Infrared Small Target Detection in Complex Scenes},
  author = {Feng Huang and Shuyuan Zheng and Zhaobing Qiu and Huanxian Liu and Huanxin Bai and Liqiong Chen},
  journal= {arXiv preprint arXiv:2503.07249},
  year   = {2025}
}