中文

基于金字塔融合的多域语义分割

计算机视觉与模式识别 2021-10-08 v5

摘要

我们展示了提交给 ECCV 2020 上举办的 Robust Vision Challenge 语义分割竞赛的方案。该竞赛要求将同一模型提交至来自三个不同域的七个基准。我们的方法基于具有金字塔融合的 SwiftNet 架构。我们通过单级 193 维 softmax 输出来处理不一致的分类体系。我们努力以大模型批次训练,以稳定困难识别问题的优化,并有利于批归一化统计的平滑演化。我们通过实现经 log-sum-prob 损失的自定义反向步,以及在冻结总体统计前使用小裁剪来实现这一点。我们的模型在 RVC 语义分割挑战赛以及 WildDash 2 排行榜上均排名第一。这表明金字塔融合不仅对于轻量骨干的高效推理具有竞争力,在多域应用的大规模设置中同样如此。

关键词

引用

@article{arxiv.2009.01636,
  title  = {Multi-domain semantic segmentation with pyramidal fusion},
  author = {Petra Bevandić and Marin Oršić and Ivan Grubišić and Josip Šarić and Siniša Šegvić},
  journal= {arXiv preprint arXiv:2009.01636},
  year   = {2021}
}

备注

2 pages, 2 tables, no figures