基于频率引导的RGB-热成像语义分割融合
计算机视觉与模式识别
2026-05-27 v1
摘要
在复杂环境中进行语义分割(如城市驾驶场景)面临着在恶劣照明条件下的挑战,此时仅靠RGB图像提供的信息不足。RGB-热成像融合利用可见光与红外图像的互补优势以提高场景理解;然而,有效地在不同特征抽象层次上整合这些异构模态仍是一个开放问题。本文提出一种基于双ConvNeXt V2主干网络构建的多模态融合架构,采用阶段性、模态自适应的融合策略。对于早期阶段特征,我们引入基于频率的融合模块,通过高斯滤波将红外特征分解为低频和高频成分,应用双分支空间注意力以选择性地强化热模式和细粒度边界,并通过置信门控残差机制将其与RGB特征融合。对于晚期阶段特征,我们设计了具有跨模态注意力和多尺度深度可分离卷积的语义融合模块,以捕获跨模态的语义对应关系。融合后的特征通过PANet风格的双向解码器进行解码,并采用深度监督。在MFNet和PST900上的实验表明,我们最轻量的变体分别实现了61.73%和86.24%的mIoU,仅使用35.43M参数,显著优于最近的方法,同时使用更少的参数和更低的计算成本。代码可在 https://github.com/ismailemrecntz/VISIBLE-INFRARED-SENSOR-FUSION 获取。
引用
@article{arxiv.2605.26273,
title = {Frequency-Guided Fusion For RGB-Thermal Semantic Segmentation},
author = {İsmail Emre Canıtez and Özgür Erkent},
journal= {arXiv preprint arXiv:2605.26273},
year = {2026}
}
备注
9 pages, 7 figures, To be Presented at Perception Beyond the Visible Spectrum workshop series (IEEE PBVS) at CVPR, 2026