中文

通过阶段式注意力机制实现上下文感知语义分割

计算机视觉与模式识别 2026-04-14 v2

摘要

语义超高分辨率(UHR)图像分割在航空制图和环境监测等遥感应用中至关重要。在这种场景下,基于 Transformer 的模型仍然面临挑战,因为内存随 token 数量呈二次增长,从而限制了空间分辨率或上下文范围。我们引入了 CASWiT(Context-Aware Stage-Wise Transformer),这是一种双分支 Swin 架构,通过轻量级的阶段式交叉注意力将低分辨率上下文信息注入细粒度高分辨率特征中。为了增强跨尺度学习,我们还提出了一种基于高分辨率图像掩码重建的 SimMIM 风格预训练策略。在大规模 FLAIR-HUB 航空数据集上的大量实验证明了 CASWiT 的有效性。在我们的纯 RGB UHR 协议下,CASWiT 结合 SegFormer 解码器达到了 66.37% 的 mIoU,在改进强 RGB 基线的同时也提升了边界质量。在 URUR 基准上,CASWiT 在官方评估协议下达到了 49.2% 的 mIoU,并且也能有效迁移到医学 UHR 分割基准。代码和预训练模型可在 https://huggingface.co/collections/heig-vd-geo/caswit 获取。

关键词

引用

@article{arxiv.2601.11310,
  title  = {Context-Aware Semantic Segmentation via Stage-Wise Attention},
  author = {Antoine Carreaud and Elias Naha and Arthur Chansel and Nina Lahellec and Jan Skaloud and Adrien Gressin},
  journal= {arXiv preprint arXiv:2601.11310},
  year   = {2026}
}