中文

用于高效 Vision Transformer 分割的 Token 空间掩码预测

计算机视觉与模式识别 2026-05-19 v1

摘要

基于查询的 Vision Transformer 分割模型通常重建密集的空间特征图来预测掩码,继承了卷积架构的设计模式。我们表明,这种显式的图像空间重建并不是必需的。我们引入了 TokenMask,一种 Token 空间掩码头,它直接从查询-Token 亲和力计算掩码 logits,并在 logit 空间而非特征空间执行插值。这种重新表述保留了原始的线性评分机制,同时简化了计算结构。在多种 ViT 主干、数据集和分割任务中,TokenMask 通过降低计算和内存需求,在效率上始终优于先前的方法,同时保持了具有竞争力的准确率,在使用 TensorRT FP16 推理的 NVIDIA Jetson AGX Orin 上实现了实质性的加速。总体而言,TokenMask 为嵌入式视觉系统提供了一种更简单、更易于部署的设计。

关键词

引用

@article{arxiv.2605.18177,
  title  = {Token-Space Mask Prediction for Efficient Vision Transformer Segmentation},
  author = {Calvin Galagain and Martyna Poreba and François Goulette},
  journal= {arXiv preprint arXiv:2605.18177},
  year   = {2026}
}

备注

CVPR, EVW 2026