MSeg:用于多域语义分割的复合数据集
计算机视觉与模式识别
2021-12-28 v1
摘要
我们提出 MSeg,一个统一了来自不同领域的语义分割数据集的复合数据集。由于分类体系与标注实践不一致,直接合并各组成数据集会导致较差的性能。我们通过重新标注超过 80,000 张图像中超过 220,000 个物体掩码,将分类体系协调一致并将像素级标注对齐,这需要超过 1.34 年的标注者集体工作量。由此产生的复合数据集能够训练一个单一语义分割模型,该模型可跨领域有效运作并泛化到训练期间未见过的数据集。我们采用零样本跨数据集迁移作为基准来系统评估模型的鲁棒性,并表明与在单个数据集上训练或未经本文贡献的朴素混合数据集训练相比,MSeg 训练产生的模型显著更具鲁棒性。在 WildDash-v1 鲁棒语义分割排行榜上,一个在 MSeg 上训练的模型排名第一,且训练期间未接触任何 WildDash 数据。我们在 2020 年鲁棒视觉挑战赛(RVC)中评估我们的模型作为极端泛化实验。MSeg 训练集仅包含 RVC 中七个数据集的三个;更重要的是,RVC 的评估分类体系不同且更细致。令人惊讶的是,我们的模型表现出有竞争力的性能并排名第二。为评估我们距离鲁棒、高效且完整的场景理解这一宏大目标还有多远,我们超越语义分割,使用我们的数据集训练实例分割与全景分割模型。此外,我们还评估了各种工程设计决策与指标,包括分辨率与计算效率。尽管我们的模型远未达成这一宏大目标,我们的综合评估对取得进展至关重要。我们向社区共享所有模型与代码。
引用
@article{arxiv.2112.13762,
title = {MSeg: A Composite Dataset for Multi-domain Semantic Segmentation},
author = {John Lambert and Zhuang Liu and Ozan Sener and James Hays and Vladlen Koltun},
journal= {arXiv preprint arXiv:2112.13762},
year = {2021}
}