MacFormer:具有精细物体边界的语义分割
计算机视觉与模式识别
2024-08-13 v1
摘要
语义分割涉及为图像中的每个像素分配特定类别。虽然基于Vision Transformer的模型已取得显著进展,但当前的语义分割方法在物体边界等局部区域往往难以进行精确预测。为应对这一挑战,我们提出了一种新的语义分割架构"MacFormer",其包含两个关键组件。第一,利用可学习智能体令牌,互智能体交叉注意力(MACA)机制有效促进了编码器与解码器层之间特征的双向集成。这使得解码过程中能够更好地保留低级特征,如基本边缘。第二,解码器中的频率增强模块(FEM)利用高频和低频分量在频域中增强特征,有益于物体边界且计算复杂度增加极小。MacFormer被证明兼容多种网络架构,在ADE20K和Cityscapes基准数据集上在不同计算约束下均优于现有方法,在准确性和效率上均表现出色。
引用
@article{arxiv.2408.05699,
title = {MacFormer: Semantic Segmentation with Fine Object Boundaries},
author = {Guoan Xu and Wenfeng Huang and Tao Wu and Ligeng Chen and Wenjing Jia and Guangwei Gao and Xiatian Zhu and Stuart Perry},
journal= {arXiv preprint arXiv:2408.05699},
year = {2024}
}
备注
13 pages, 7 figures, submitted to TIP