中文

ALGM:用于纯视觉变换器高效语义分割的自适应局部—全局令牌合并

计算机视觉与模式识别 2024-06-17 v1

摘要

本工作提出了自适应局部—全局合并(ALGM),这是一种用于采用纯视觉变换器的语义分割网络的令牌压缩方法。ALGM在两个阶段内合并相似令牌:(1)在第一个网络层中,它在小型局部窗口内合并相似令牌;(2)在网络中段,它跨整个图像合并相似令牌。这一方法的动机来自我们发现,在上述情况下,余弦相似度较高的令牌可以无需分割质量下降的情况下进行合并。通过在多个数据集和网络配置上进行大量实验,我们表明ALGM不仅显著提高了吞吐量(最高可提高100%),还能将平均IoU提高最高1.1个百分点,从而在分割质量和效率之间实现更好的权衡。此外,我们的方法在推理期间是自适应的,这意味着相同模型可用于最佳效率或准确性,具体取决于应用程序。代码已提供于https://tue-mps.github.io/ALGM。

关键词

引用

@article{arxiv.2406.09936,
  title  = {ALGM: Adaptive Local-then-Global Token Merging for Efficient Semantic Segmentation with Plain Vision Transformers},
  author = {Narges Norouzi and Svetlana Orlova and Daan de Geus and Gijs Dubbelman},
  journal= {arXiv preprint arXiv:2406.09936},
  year   = {2024}
}

备注

CVPR 2024. Project page and code: https://tue-mps.github.io/ALGM