UNIP:重新思考红外语义分割的预训练注意力模式
计算机视觉与模式识别
2025-03-21 v2
摘要
预训练技术显著提升了训练数据有限的语义分割任务的性能。然而,在预训练(如 RGB)与微调(如红外)之间存在大领域差异时的有效性仍有待探索。在本研究中,我们首先对各种预训练方法的红外语义分割性能进行了基准测试,并揭示了若干不同于 RGB 领域的现象。接着,我们对预训练注意力图进行了逐层分析,发现:(1) 存在三种典型的注意力模式(局部、混合和全局);(2) 预训练任务显著影响各层的模式分布;(3) 混合模式对语义分割至关重要,因为它同时关注邻近元素和前景元素;(4) 纹理偏置阻碍了模型在红外任务中的泛化能力。基于这些洞察,我们提出了 UNIP,一个统一红外预训练框架,以增强预训练模型的性能。该框架使用混合注意力蒸馏 NMI-HAD 作为预训练目标,使用大规模混合数据集 InfMix 进行预训练,并使用最后一层特征金字塔网络 LL-FPN 进行微调。实验结果表明,在三个红外分割任务上,使用微调和线性探测指标评估时,UNIP 的平均 mIoU 比各种预训练方法高出最多 13.5%。UNIP-S 在仅需 1/10 计算成本的情况下,实现了与 MAE-L 相当的性能。此外,UNIP 显著超越了最先进的红外或 RGB 分割方法,并展现出在其他模态(如 RGB 和深度)中广泛的应用潜力。我们的代码可在 https://github.com/casiatao/UNIP 获取。
引用
@article{arxiv.2502.02257,
title = {UNIP: Rethinking Pre-trained Attention Patterns for Infrared Semantic Segmentation},
author = {Tao Zhang and Jinyong Wen and Zhen Chen and Kun Ding and Shiming Xiang and Chunhong Pan},
journal= {arXiv preprint arXiv:2502.02257},
year = {2025}
}
备注
ICLR 2025. 27 pages, 13 figures, 21 tables