通过中继 token 适配超高分辨率语义分割的 Vision Transformer
计算机视觉与模式识别
2026-01-12 v1
摘要
当前用于分割超高分辨率图像的方法要么在窗口上滑动,丢弃全局上下文,要么下采样导致细节丢失。我们提出一种简单而有效的方法,为 Vision Transformer 引入显式的多尺度推理,同时保持局部细节和全局感知。具体而言,我们在局部尺度(高分辨率、小裁剪)和全局尺度(低分辨率、大裁剪)上并行处理每张图像,通过少量可学习的中继 token 在两个分支之间聚合和传播特征。该设计直接插接到标准 Transformer 主干网络(如 ViT 和 Swin)上,只添加不到 2% 的参数。在三个超高分辨率分割基准数据集 Archaeoscape、URUR、Gleason 上,以及常规 Cityscapes 数据集上进行大量实验,结果一致获得提升,其中最高可达 15% 的相对 mIoU 提升。代码和预训练模型已在 https://archaeoscape.ai/work/relay-tokens/ 提供。
引用
@article{arxiv.2601.05927,
title = {Adapting Vision Transformers to Ultra-High Resolution Semantic Segmentation with Relay Tokens},
author = {Yohann Perron and Vladyslav Sydorov and Christophe Pottier and Loic Landrieu},
journal= {arXiv preprint arXiv:2601.05927},
year = {2026}
}
备注
13 pages +3 pages of suppmat