中文

利用自编码器识别监督学习中的错误标注图像

计算机视觉与模式识别 2022-01-06 v2 机器学习

摘要

监督学习基于训练数据中真值准确的假设。然而,在真实场景中这未必能得到保证。不准确的训练数据会导致一些非预期的预测。在图像分类中,不正确的标签也可能使分类模型不准确。本文中,我将在训练分类网络之前对训练数据应用无监督技术。采用卷积自编码器对图像进行编码与重建,编码器将图像数据投影到潜空间。在潜空间中,图像特征以更低维度被保留。假设是具有相似特征的数据样本很可能具有相同的标签。噪声样本可由基于密度的扫描(DBSCAN)聚类算法在潜空间中被分类,这些错误标注的数据在潜空间中可视化为离群点。因此,由 DBSCAN 算法识别的离群点可被归类为错误标注样本。检测到离群点后,所有离群点被视为错误标注的数据样本并从数据集中移除,从而训练数据可直接用于训练监督学习网络。该算法在实验数据集中可检测并移除超过 67% 的错误标注数据。

关键词

引用

@article{arxiv.2011.03667,
  title  = {Identifying Mislabeled Images in Supervised Learning Utilizing Autoencoder},
  author = {Yunhao Yang and Andrew Whinston},
  journal= {arXiv preprint arXiv:2011.03667},
  year   = {2022}
}

备注

UTCS Tech Report: Honors Thesis. 12 pages, 11 figures