P2AT:用于实时语义分割的金字塔池化轴向Transformer
计算机视觉与模式识别
2024-07-22 v1
摘要
近来,基于Transformer的模型因能建模长程依赖而在各种视觉任务中取得了可喜结果。然而,Transformer计算开销大,限制了其在自动驾驶等实时任务中的应用。此外,高效的局部与全局特征选择及融合对于准确的密集预测至关重要,尤其是驾驶场景理解任务。本文提出一种名为金字塔池化轴向Transformer(P2AT)的实时语义分割架构。所提P2AT利用来自CNN编码器的粗特征生成尺度感知上下文特征,随后与多级特征聚合方案结合以产生增强的上下文特征。具体而言,我们引入金字塔池化轴向Transformer来捕获复杂的空间与通道依赖,从而提升语义分割性能。接着,我们设计双向融合模块(BiF)以组合不同层级的语义信息。同时,引入全局上下文增强器以弥补拼接不同语义层级的不足。最后,提出解码器块以帮助维持更大的感受野。我们在三个具挑战性的场景理解数据集上评估P2AT变体。特别地,我们的P2AT变体在Camvid数据集上取得SOTA结果,P2AT-S、P2ATM和P2AT-L分别达到80.5%、81.0%、81.1%。此外,我们在Cityscapes和Pascal VOC 2012上的实验证明了所提架构的高效性,结果显示P2AT-M在Cityscapes上达到78.7%。源代码将发布于
引用
@article{arxiv.2310.15025,
title = {P2AT: Pyramid Pooling Axial Transformer for Real-time Semantic Segmentation},
author = {Mohammed A. M. Elhassan and Changjun Zhou and Amina Benabid and Abuzar B. M. Adam},
journal= {arXiv preprint arXiv:2310.15025},
year = {2024}
}