中文

L-MAE:掩码自编码器作为语义分割数据集增强器

计算机视觉与模式识别 2023-10-03 v2 人工智能

摘要

生成语义分割数据集一直费力且耗时,尤其在大型模型或专业领域(如医学影像或遥感)中。具体而言,大型模型需要大量数据,而专业领域数据集常需领域专家参与。两种情形都易出现数据标注不准确,从而显著影响训练模型的最终性能。本文提出一种简单有效的标签像素级补全方法,即\textbf{标签掩码自编码器}(L-MAE),其充分利用标签中已有信息生成完整标签。所提模型首次将掩码自编码器应用于下游任务。具体地,L-MAE 采用将标签与对应图像堆叠的融合策略,即融合图。此外,由于掩码融合图时部分图像信息丢失,直接重建可能导致性能不佳。我们提出图像块补充算法以在掩码-重建过程中补充缺失信息,并经实验发现平均可提升 4.1\% mIoU。我们进行了实验以评估 L-MAE 补全数据集的效力。我们使用降质的 Pascal VOC 数据集及经 L-MAE 增强的降质数据集训练相同的常规语义分割模型进行初始实验。实验结果表明,使用 L-MAE 增强数据集训练的模型相比未增强数据集性能提升 13.5\%。

关键词

引用

@article{arxiv.2211.11242,
  title  = {L-MAE: Masked Autoencoders are Semantic Segmentation Datasets Augmenter},
  author = {Jiaru Jia and Mingzhe Liu and Jiake Xie and Xin Chen and Hong Zhang and Feixiang Zhao and Aiqing Yang},
  journal= {arXiv preprint arXiv:2211.11242},
  year   = {2023}
}