中文

一种结合半监督分类与聚类的以数据为中心方法用于改善模糊标签

计算机视觉与模式识别 2022-10-07 v4

摘要

持续的高数据质量对于深度学习领域新型损失函数与架构的发展至关重要。此类数据与标签的存在通常被假定,而在许多情况下获取高质量数据集仍是一大难题。在真实数据集中,我们常因标注者的主观标注而遇到模糊标签。在我们的以数据为中心方法中,我们提出一种重新标注此类模糊标签的方法,而非在神经网络中实现对这一问题的处理。硬性分类按定义不足以捕捉数据的真实世界模糊性。因此,我们提出“以数据为中心的分类与聚类(DC3)”方法,其结合了半监督分类与聚类。它自动估计图像的模糊性,并依据该模糊性执行分类或聚类。DC3本质通用,故可辅以多种半监督学习(SSL)算法使用。平均而言,这在多个被评估SSL算法与数据集上带来了分类F1分数提升7.6%,以及簇内距离降低7.9%。最为重要的是,我们给出了概念验证:来自DC3的分类与聚类可作为此类模糊标签人工精修的有益提议。总体而言,SSL与我们DC3方法的结合能在标注过程中更好地处理模糊标签。

关键词

引用

@article{arxiv.2106.16209,
  title  = {A data-centric approach for improving ambiguous labels with combined semi-supervised classification and clustering},
  author = {Lars Schmarje and Monty Santarossa and Simon-Martin Schröder and Claudius Zelenka and Rainer Kiko and Jenny Stracke and Nina Volkmann and Reinhard Koch},
  journal= {arXiv preprint arXiv:2106.16209},
  year   = {2022}
}

备注

Source code is available at https://github.com/Emprime/dc3, Datasets available at https://doi.org/10.5281/zenodo.5550916