SERNet-Former:基于带注意力增强门与注意力融合网络的高效残差网络的语义分割
计算机视觉与模式识别
2026-01-05 v7 人工智能
摘要
提升语义分割中 state-of-the-art 方法的效率,需要克服不断增加的计算成本以及融合全局与局部上下文语义信息等问题。基于卷积神经网络在语义分割中近期的成功及其遇到的问题,本研究提出了一种具有独特高效残差网络 Efficient-ResNet 的编码器-解码器架构。通过部署注意力增强门和注意力增强模块,旨在将等变与基于特征的语义信息与编码器中高效残差网络全局上下文输出的等效尺寸进行融合。相应地,受 AbM 启发,解码器网络开发了额外的注意力融合网络。AfNs 旨在通过在解码器部分部署额外的卷积层来提高语义信息一对一转换的效率。我们的网络在具有挑战性的 CamVid 和 Cityscapes 数据集上进行了测试,所提方法在残差网络上展现出显著改进。据我们所知,所开发的网络 SERNet-Former 在 CamVid 数据集上取得了 state-of-the-art 的结果(84.62% 平均 IoU),并在 Cityscapes 验证集上取得了极具竞争力的结果(87.35% 平均 IoU)。
引用
@article{arxiv.2401.15741,
title = {SERNet-Former: Semantic Segmentation by Efficient Residual Network with Attention-Boosting Gates and Attention-Fusion Networks},
author = {Serdar Erisen},
journal= {arXiv preprint arXiv:2401.15741},
year = {2026}
}