通用 RGB-X 语义分割模型 SegRGB-X
计算机视觉与模式识别
2026-03-31 v1
摘要
语义分割跨任意传感器模态面临显著挑战,传统配置导致开发效率低下。我们通过引入统一的任意模态语义分割框架来解决这些挑战,该框架统一了多个模态上的分割任务。我们的方法包含三个关键创新:(1) 采用 Modality-aware CLIP (MA-CLIP),通过 LoRA 微调提供模态特定的场景理解指导;(2) 用于捕捉细粒度特征的模态对齐嵌入;(3) 用于动态特征调整的领域特定精炼模块 (DSRM)。在具有不同互补模态 (事件、热成像、深度、偏振和光场) 的五个数据集上进行评估,我们的模型超越了专门的多模态方法,实现了 65.03% 的 mIoU 实现了最先进的性能。代码将在接受后发布。
引用
@article{arxiv.2603.28023,
title = {SegRGB-X: General RGB-X Semantic Segmentation Model},
author = {Jiong Liu and Yingjie Xu and Xingcheng Zhou and Rui Song and Walter Zimmer and Alois Knoll and Hu Cao},
journal= {arXiv preprint arXiv:2603.28023},
year = {2026}
}
备注
Submitted to IEEE TITS