中文

MaSS13K:一个遮罩级语义分割基准

计算机视觉与模式识别 2025-07-09 v2

摘要

高分辨率语义分割对于图像编辑、景深成像、AR/VR 等应用至关重要。不幸的是,现有数据集通常分辨率有限,缺乏精确的掩码细节和边界。本文构建了一个大规模、遮罩级语义分割数据集,命名为MaSS13K,包含13,348张真实世界图像,全部采用4K 分辨率。MaSS13K 提供多个对象的高质量掩码标注,分为七个类别:人类、植被、地面、天空、水体、建筑和其他。MaSS13K 特点在于提供精确掩码,平均掩码复杂度比现有语义分割数据集高出20-50 倍。因此,我们提出一种专为高分辨率语义分割设计的方法,称为MaSSFormer,采用高效像素解码器跨三个阶段聚合高层语义特征和低层纹理特征,以在最小计算成本下生成高分辨率掩码。最后,我们提出一种新的学习范式,将给定七个类别的高质量掩码与来自新类别的伪标签相结合,使MaSSFormer 能够将其准确的分割能力传递给其他类别的对象。我们在MaSS13K 基准上全面评估了MaSSFormer,同时还评估了14 个具有代表性的分割模型。我们期望本精心标注的MaSS13K 数据集和MaSSFormer 模型能够促进高分辨率和高质量语义分割的研究。数据集和代码可在 https://github.com/xiechenxi99/MaSS13K 找到。

关键词

引用

@article{arxiv.2503.18364,
  title  = {MaSS13K: A Matting-level Semantic Segmentation Benchmark},
  author = {Chenxi Xie and Minghan Li and Hui Zeng and Jun Luo and Lei Zhang},
  journal= {arXiv preprint arXiv:2503.18364},
  year   = {2025}
}

备注

CVPR2025