用于多域语义分割的通用视觉概念的弱监督训练
计算机视觉与模式识别
2024-03-13 v3
摘要
深度监督模型具有吸收大量训练数据的空前能力。因此,在多个数据集上进行训练成为在常规场景中实现强泛化、在边缘情况中实现优雅性能退化的一种首选方法。遗憾的是,不同的数据集通常具有不兼容的标签。例如,Cityscapes 的道路类涵盖了所有驾驶路面,而 Vistas 则为道路标线、井盖等定义了单独的类别。此外,许多数据集存在重叠的标签。例如,皮卡车在 VIPER 中被标记为卡车,在 Vistas 中被标记为汽车,而在 ADE20k 中被标记为厢式货车。我们通过将标签视为通用视觉概念的并集来解决这一挑战。这使得在多域数据集集合上能够进行无缝且原则性的学习,而无需任何重新标注的工作。我们的方法在数据集内和数据集间的泛化能力上均具竞争力,并且能够学习在任何训练数据集中均未被单独标记的视觉概念。实验表明,在两个多域数据集集合和 WildDash 2 基准测试上,该方法取得了具有竞争力或 SOTA 的性能。
引用
@article{arxiv.2212.10340,
title = {Weakly supervised training of universal visual concepts for multi-domain semantic segmentation},
author = {Petra Bevandić and Marin Oršić and Ivan Grubišić and Josip Šarić and Siniša Šegvić},
journal= {arXiv preprint arXiv:2212.10340},
year = {2024}
}
备注
27 pages, 16 figures, 10 tables, accepted to International Journal of Computer Vision