ContextFormer:重新定义语义分割的效率
计算机视觉与模式识别
2025-03-11 v2
摘要
语义分割为图像中的像素分配标签,是计算机视觉中一项关键且具挑战性的任务。卷积方法虽然能很好地捕获局部依赖关系,但在处理长程关系时存在困难。Vision Transformers (ViTs) 擅长捕获全局上下文,但受制于高昂的计算需求,尤其是对于高分辨率输入。大多数研究优化编码器架构,而忽略了瓶颈区域的探索——这是提升性能与效率的关键领域。我们提出 ContextFormer,这是一个在瓶颈区域利用 CNNs 和 ViTs 优势的混合框架,旨在平衡实时语义分割的效率、准确性和鲁棒性。该框架的效率由三个协同模块驱动:用于分层多尺度表示的 Token 金字塔提取模块、用于动态尺度感知特征建模的 Transformer 与分支深度卷积块,以及用于增强空间和上下文一致性的稳健整合的特征合并模块。在 ADE20K、Pascal Context、CityScapes 和 COCO-Stuff 数据集上的大量实验表明,ContextFormer 显著优于现有模型,取得了 SOTA 的 mIoU 分数,为效率和性能设定了新的基准。代码将在论文被接收后公开发布。
引用
@article{arxiv.2501.19255,
title = {ContextFormer: Redefining Efficiency in Semantic Segmentation},
author = {Mian Muhammad Naeem Abid and Nancy Mehta and Zongwei Wu and Radu Timofte},
journal= {arXiv preprint arXiv:2501.19255},
year = {2025}
}