SPIRIT:适配视觉基础模型用于统一的单帧与多帧红外小目标检测
计算机视觉与模式识别
2026-02-03 v1
摘要
红外小目标检测(IRSTD)是监控和预警的关键任务,部署范围涵盖单帧分析和视频模式跟踪。实用方案应利用视觉基础模型(VFMs)来缓解红外数据稀缺问题,同时采用基于记忆注意力的时序传播框架实现单帧和多帧推理的统一。然而,红外小目标表现出弱的辐射信号和有限的语义线索,这些特征与可见光图像有显著差异。这种模态差距使得直接使用语义导向的 VFMs 和基于外观的跨帧关联变得不可靠用于 IRSTD:层次特征聚合会淹没局部目标峰值,基于外观的记忆注意力变得模糊,导致不必要的杂波关联。为此,我们提出 SPIRIT,一个统一且兼容 VFM 的框架,通过轻量级 physics-informed plug-ins 适配 VFMs 以适用于 IRSTD。从空间上看,PIFR 通过近似秩稀疏分解来细化特征,以抑制结构化背景成分并增强稀疏目标信号。从时序上看,PGMA 将历史派生的软空间先验注入记忆跨注意力,以约束跨帧关联,实现鲁健的视频检测,同时在没有时序上下文时自然地退化为单帧推理。实验表明,在多个 IRSTD 基准测试中,SPIRIT consistently 超越 VFM 基线并实现 SOTA 性能。
引用
@article{arxiv.2602.01843,
title = {SPIRIT: Adapting Vision Foundation Models for Unified Single- and Multi-Frame Infrared Small Target Detection},
author = {Qian Xu and Xi Li and Fei Gao and Jie Guo and Haojuan Yuan and Shuaipeng Fan and Mingjin Zhang},
journal= {arXiv preprint arXiv:2602.01843},
year = {2026}
}