中文

ResT V2:更简洁、更快速、更强大

计算机视觉与模式识别 2022-09-28 v3

摘要

本文提出ResTv2,一种更简洁、更快速、更强大的多尺度视觉Transformer(Transformer),用于视觉识别。ResTv2简化了ResTv1中的EMSA结构(即去除了多头交互部分),并采用上采样操作来重建由下采样操作导致的丢失的中高频信息。此外,我们探索了不同技术以更好地将ResTv2骨干网络应用于下游任务。我们发现,尽管结合EMSAv2与窗口注意力可大幅降低理论矩阵乘法FLOPs,但可能显著减小计算密度,从而导致实际速度降低。我们在ImageNet分类、COCO检测与ADE20K语义分割上全面验证了ResTv2。实验结果表明,所提ResTv2能以较大优势优于近期最先进(SOTA)的骨干网络,展示了其作为坚实骨干网络的潜力。代码与模型将公开于\url{https://github.com/wofmanaf/ResT}。

关键词

引用

@article{arxiv.2204.07366,
  title  = {ResT V2: Simpler, Faster and Stronger},
  author = {Qing-Long Zhang and Yu-Bin Yang},
  journal= {arXiv preprint arXiv:2204.07366},
  year   = {2022}
}

备注

ResTv2, a simpler, faster, and stronger multi-scale vision Transformer for visual recognition