轻量级多信息交互网络用于语义分割
计算机视觉与模式识别
2025-04-02 v2
摘要
最近, 将卷积神经网络(CNN)的局部建模能力与 Transformer 的全局依赖能力相集成,正在推动语义分割领域的发展。然而,大量的计算负载和高硬件内存需求仍是其在实时场景中进一步应用的主要障碍。本文提出了轻量级多信息交互网络(LMIINet),用于实时语义分割,通过降低冗余计算和内存占用,有效地结合了 CNN 和 Transformer。其特点是轻量级特征交互瓶颈(LFIB)模块,包含高效卷积,以增强上下文集成。此外,还对 Flatten Transformer 进行了改进,通过增强局部和全局特征交互以捕获详细的语义信息。在 LFIB 和 Transformer 模块中引入组合系数学习方案,可促进更好的特征交互。广泛的实验表明,LMIINet 在准确率和效率之间取得了优异的平衡。仅使用 0.72M 参数和 11.74G FLOPs(每秒浮点运算次数),LMIINet 在单张 RTX2080Ti GPU 上,即可在 Cityscapes 测试集上实现 72.0% mIoU 且帧率达 100 FPS,在 CamVid 测试数据集上实现 69.94% mIoU 且帧率达 160 FPS。
引用
@article{arxiv.2410.02224,
title = {Efficient Semantic Segmentation via Lightweight Multiple-Information Interaction Network},
author = {Yangyang Qiu and Guoan Xu and Guangwei Gao and Zhenhua Guo and Yi Yu and Chia-Wen Lin},
journal= {arXiv preprint arXiv:2410.02224},
year = {2025}
}
备注
10 pages, 6 figures, 9 tables