中文

ARTA:用于高效密集特征提取的自适应混合分辨率 Token 分配

计算机视觉与模式识别 2026-03-30 v1 人工智能 机器学习

摘要

我们提出了 ARTA,一个用于高效密集特征提取的混合分辨率自顶向下 vision transformer。与从密集高分辨率(细粒度)token 开始的模型不同,ARTA 从低分辨率(粗粒度)token 开始,并使用轻量级分配器预测哪些区域需要更多细粒度 token。分配器迭代地预测语义(类别)边界分数,并将额外 token 分配给高于低阈值的补丁,将 token 密度集中在边界附近,同时保持对弱边界证据的高敏感性。这种定向分配鼓励 token 代表单一语义类别而非混合类别。混合分辨率注意力使粗粒度和细粒度 token 之间能够交互,将计算集中在语义复杂区域,同时避免在同质区域进行冗余处理。实验表明,ARTA 在 ADE20K 和 COCO-Stuff 上取得了最先进的结果,同时大幅减少了 FLOPs,并在显著更低的计算量下在 Cityscapes 上提供了有竞争力的性能。例如,ARTA-Base 在约 1 亿参数类别中在 ADE20K 上达到了 54.6 mIoU,同时使用的 FLOPs 和内存少于可比骨干网络。

关键词

引用

@article{arxiv.2603.26258,
  title  = {ARTA: Adaptive Mixed-Resolution Token Allocation for Efficient Dense Feature Extraction},
  author = {David Hagerman and Roman Naeem and Erik Brorsson and Fredrik Kahl and Lennart Svensson},
  journal= {arXiv preprint arXiv:2603.26258},
  year   = {2026}
}