中文

利用 CNN 基于 Pascal VOC 的语义分割研究

计算机视觉与模式识别 2023-05-08 v2 人工智能

摘要

在本文中,我们提出了一项基于 Pascal VOC 数据集的语义分割综合研究。此处,我们必须为每个像素标注一个类别,从而基于存在的物体/实体分割整幅图像。为此,我们首先使用全卷积网络(FCN)基线,其像素准确率为 71.31%,平均 IoU 为 0.0527。我们分析其性能与工作机制,随后通过三项改进解决基线中的问题:a) 余弦退火学习率调度器(像素准确率:72.86%,IoU:0.0529),b) 数据增强(像素准确率:69.88%,IoU:0.0585),c) 类别不平衡权重(像素准确率:68.98%,IoU:0.0596)。除训练流程中的这些改变外,我们还探索了三种不同架构:a) 我们提出的模型——高级 FCN(像素准确率:67.20%,IoU:0.0602),b) 基于 ResNet 的迁移学习(最佳性能)(像素准确率:71.33%,IoU:0.0926),c) U-Net(像素准确率:72.15%,IoU:0.0649)。我们观察到这些改进极大地提升了性能,这反映在指标和分割图中。有趣的是,我们观察到在各项改进中,数据集增强贡献最大。同时请注意,迁移学习模型在 pascal 数据集上表现最佳。我们利用损失、准确率和 IoU 曲线以及分割图分析了这些模型的性能,这有助于我们获得关于模型工作机制的宝贵见解。

关键词

引用

@article{arxiv.2304.13216,
  title  = {Exploiting CNNs for Semantic Segmentation with Pascal VOC},
  author = {Sourabh Prakash and Priyanshi Shah and Ashrya Agrawal},
  journal= {arXiv preprint arXiv:2304.13216},
  year   = {2023}
}