中文

无嵌入 Transformer 及推理空间缩减的高效语义分割

计算机视觉与模式识别 2024-07-25 v1

摘要

我们提出了一种 Encoder-Decoder Attention Transformer (EDAFormer),由 Embedding-Free Transformer (EFT) 编码器和利用我们 Embedding-Free Attention (EFA) 结构的全注意力解码器组成。所提出的 EFA 是一种新的全局上下文建模机制,侧重于发挥全局非线性功能,而非特定的查询、键和值角色。在解码器方面,我们探索了针对考虑全局性的最优化结构,这可以提高语义分割性能。此外,我们提出了一种新的推理空间缩减 (ISR) 方法用于提高计算效率。不同于以前的空间缩减注意力方法,我们的 ISR 方法在推理阶段进一步降低键值分辨率,这可以减缓高效语义分割中计算性能权衡的差距。我们的 EDAFormer 在三个公开基准数据集(包括 ADE20K、Cityscapes 和 COCO-Stuff)上显示出与现有基于 transformer 的语义分割模型相比的领先性能。此外,我们的 ISR 方法在 Cityscapes 数据集上可将计算成本降低最高 61%,同时对 mIoU 性能影响最小。代码已公开于 https://github.com/hyunwoo137/EDAFormer。

关键词

引用

@article{arxiv.2407.17261,
  title  = {Embedding-Free Transformer with Inference Spatial Reduction for Efficient Semantic Segmentation},
  author = {Hyunwoo Yu and Yubin Cho and Beoungwoo Kang and Seunghun Moon and Kyeongbo Kong and Suk-Ju Kang},
  journal= {arXiv preprint arXiv:2407.17261},
  year   = {2024}
}

备注

Accepted by ECCV 2024