中文

TUNI:基于统一多模态特征提取与跨模态特征融合的实时 RGB-T 语义分割

计算机视觉与模式识别 2025-09-15 v1

摘要

RGB-热红外(RGB-T)语义分割提高了自主平台在挑战性条件下的环境感知能力。现有模型采用在 RGB 图像上预训练的编码器来提取 RGB 和红外输入的特征,并设计额外的模块以实现跨模态特征融合。这导致热红外特征提取受限且跨模态融合效果欠佳,而冗余的编码器进一步损害了模型的实时效率。为了解决上述问题,我们提出了 TUNI,其 RGB-T 编码器由多个堆叠块组成,可同时执行多模态特征提取和跨模态融合。通过利用 RGB 和伪热红外数据进行大规模预训练,该 RGB-T 编码器学会了以统一的方式整合特征提取与融合。通过精简热红外分支,该编码器实现了更紧凑的架构。此外,我们引入了一个 RGB-T 局部模块,以增强编码器跨模态局部特征融合的能力。该 RGB-T 局部模块采用自适应余弦相似度,选择性地强调跨 RGB-T 模态的显著一致且独特的局部特征。实验结果表明,TUNI 在 FMB、PST900 和 CART 数据集上以更少的参数和更低的计算成本实现了与 SOTA 模型相当的性能。同时,它在 Jetson Orin NX 上达到了 27 FPS 的推理速度,证明了其在部署中的实时能力。代码可在 https://github.com/xiaodonguo/TUNI 获取。

关键词

引用

@article{arxiv.2509.10005,
  title  = {TUNI: Real-time RGB-T Semantic Segmentation with Unified Multi-Modal Feature Extraction and Cross-Modal Feature Fusion},
  author = {Xiaodong Guo and Tong Liu and Yike Li and Zi'ang Lin and Zhihong Deng},
  journal= {arXiv preprint arXiv:2509.10005},
  year   = {2025}
}