中文

CV 3315 足矣:语义分割竞赛

计算机视觉与模式识别 2022-07-05 v2

摘要

本竞赛聚焦于基于车载摄像头视角的城市感知分割。类别高度不均衡的城市感知图像数据集对现有解决方案及进一步研究提出了挑战。基于深度卷积神经网络的语义分割方法,如编码器-解码器架构以及多尺度与基于金字塔的方法,成为可灵活应用于实际场景的解决方案。在本竞赛中,我们主要回顾文献并基于 transformer 驱动的方法(尤其是 SegFormer)进行实验,以在性能与效率间取得最优权衡。例如,SegFormer-B0 以最小的 FLOPS(15.6G)取得了 74.6% 的 mIoU,而最大模型 SegFormer-B5 达到了 80.2% 的 mIoU。根据包括个案失败分析、各类别性能、训练压力与效率估计在内的多因素,竞赛的最终候选模型为 SegFormer-B2,其在测试集上以 50.6 GFLOPS 取得了 78.5% 的 mIoU。代码实现见 https://vmv.re/cv3315。

关键词

引用

@article{arxiv.2206.12571,
  title  = {CV 3315 Is All You Need : Semantic Segmentation Competition},
  author = {Akide Liu and Zihan Wang},
  journal= {arXiv preprint arXiv:2206.12571},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:2105.15203 by other authors