面向高效通用分割的 Transformer 编码器渐进式 Token 长度缩放
计算机视觉与模式识别
2025-04-01 v3
摘要
一种强大的通用分割架构依赖于 Transformer,后者将多尺度图像特征编码并将目标查询解码为掩码预测。鉴于效率是扩展此类模型时的首要优先级,我们观察到最先进的 Mask2Former 方法仅在其 Transformer 编码器上就消耗了 50% 的计算量。这是由于在每个编码器层都保留了所有主干特征尺度的全长 Token 级表示。基于这一观察,我们提出了一种称为面向高效 Transformer 编码器的渐进式 Token 长度缩放(PRO-SCALE)的策略,该策略可插入 Mask2Former 分割架构中以显著降低计算成本。PRO-SCALE 的基本原理是:随着编码器层数的增加,渐进式缩放 Token 的长度。这使得 PRO-SCALE 能够在性能损失极小的情况下大幅减少计算量(在 COCO 数据集上性能无下降的情况下,编码器减少约 52%,总体 GFLOPs 减少约 27%)。在公开基准上进行的实验证明了 PRO-SCALE 在架构配置上的灵活性,并展现出超越分割任务设置扩展至目标检测的潜力。代码见:https://github.com/abhishekaich27/proscale-pytorch
引用
@article{arxiv.2404.14657,
title = {Progressive Token Length Scaling in Transformer Encoders for Efficient Universal Segmentation},
author = {Abhishek Aich and Yumin Suh and Samuel Schulter and Manmohan Chandraker},
journal= {arXiv preprint arXiv:2404.14657},
year = {2025}
}
备注
Accepted to ICLR 2025