中文

ContextFormer:重新定义语义分割的效率

计算机视觉与模式识别 2025-03-11 v2

摘要

语义分割为图像中的像素分配标签,是计算机视觉中一项关键且具挑战性的任务。卷积方法虽然能很好地捕获局部依赖关系,但在处理长程关系时存在困难。Vision Transformers (ViTs) 擅长捕获全局上下文,但受制于高昂的计算需求,尤其是对于高分辨率输入。大多数研究优化编码器架构,而忽略了瓶颈区域的探索——这是提升性能与效率的关键领域。我们提出 ContextFormer,这是一个在瓶颈区域利用 CNNs 和 ViTs 优势的混合框架,旨在平衡实时语义分割的效率、准确性和鲁棒性。该框架的效率由三个协同模块驱动:用于分层多尺度表示的 Token 金字塔提取模块、用于动态尺度感知特征建模的 Transformer 与分支深度卷积块,以及用于增强空间和上下文一致性的稳健整合的特征合并模块。在 ADE20K、Pascal Context、CityScapes 和 COCO-Stuff 数据集上的大量实验表明,ContextFormer 显著优于现有模型,取得了 SOTA 的 mIoU 分数,为效率和性能设定了新的基准。代码将在论文被接收后公开发布。

关键词

引用

@article{arxiv.2501.19255,
  title  = {ContextFormer: Redefining Efficiency in Semantic Segmentation},
  author = {Mian Muhammad Naeem Abid and Nancy Mehta and Zongwei Wu and Radu Timofte},
  journal= {arXiv preprint arXiv:2501.19255},
  year   = {2025}
}