中文

多编码器ConvNeXt网络与平滑注意力特征融合用于多光谱语义分割

计算机视觉与模式识别 2026-04-15 v1 人工智能

摘要

本工作提出MeCSAFNet,一个用于多光谱图像中地覆盖分割的多支路编码器-解码器架构。该模型分别通过双ConvNeXt编码器处理可见光和非可见光通道,随后通过各自的解码器重建空间信息。一个专门的融合解码器在多个尺度上整合中间特征,结合细粒度空间线索与高级光谱表征。特征融合进一步通过CBAM注意力机制增强,ASAU激活函数有助于稳定和高效优化。该模型设计用于处理不同的光谱配置,包括4通道(4c)输入(将RGB与NIR波段合并),以及6通道(6c)输入(包含NDVI和NDWI指数)。在Five-Billion-Pixels(FBP)和Potsdam数据集上的实验表明性能显著提升。在FBP上,MeCSAFNet-base(6c)相较于U-Net(4c)提升+19.21%,U-Net(6c)提升+14.72%,SegFormer(4c)提升+19.62%,SegFormer(6c)提升+14.74%(以mIoU为指标)。在Potsdam上,MeCSAFNet-large(4c)相较于DeepLabV3+(4c)提升+6.48%,DeepLabV3+(6c)提升+5.85%,SegFormer(4c)提升+9.11%,SegFormer(6c)提升+4.80%(以mIoU为指标)。该模型还在多个最新SOTA方法上实现持续性能提升。此外,MeCSAFNet的紧凑型变体在更低的训练时间和减少的推理成本下实现显著性能,支持在资源受限的环境中部署。

关键词

引用

@article{arxiv.2602.10137,
  title  = {Multi-encoder ConvNeXt Network with Smooth Attentional Feature Fusion for Multispectral Semantic Segmentation},
  author = {Leo Thomas Ramos and Angel D. Sappa},
  journal= {arXiv preprint arXiv:2602.10137},
  year   = {2026}
}

备注

This is an extended version of the study presented at IEEE SoutheastCon2025. It presents substantial new content and original contributions beyond the previous version, including an expanded and enhanced background, new architectural refinements, additional experiments conducted on a broader range of datasets and experimental scenarios, and a more comprehensive analysis of results