中文

探索视觉 Transformer 层选择用于语义分割

计算机视觉与模式识别 2023-05-10 v1

摘要

大量工作已证明 Vision Transformer 的有效性。普通 Vision Transformer 往往通过选择固定层或最后一层特征来获取多尺度特征,旨在密集预测任务中取得更高性能。然而,这种选择通常基于人工操作。并且不同样本在不同层往往表现出不同特征(例如边缘、结构、纹理、细节等)。这要求我们寻求一种动态自适应融合方法来筛选不同层特征。本文中,不同于以往的编码器与解码器工作,我们设计了一个用于自适应融合与特征选择的颈网络,称为 ViTController。我们在不同数据集和模型上验证了方法的有效性,并超越了以往的 SOTA 方法。最后,我们的方法也可作为插件模块插入不同网络中使用。

关键词

引用

@article{arxiv.2305.01279,
  title  = {Exploring vision transformer layer choosing for semantic segmentation},
  author = {Fangjian Lin and Yizhe Ma and Shengwei Tian},
  journal= {arXiv preprint arXiv:2305.01279},
  year   = {2023}
}

备注

Accepted by IEEE ICASSP