中文

利用未标注数据提升生物特征性别与年龄分类器的泛化能力

计算机视觉与模式识别 2021-10-12 v1 人工智能 机器学习

摘要

随着深度学习的显著进展,许多计算机视觉应用已达到拐点。然而,这些深度学习模型需要大量标注数据以进行模型训练与最优参数估计。用于模型训练的标注数据有限会导致过拟合并影响其泛化性能。然而,大量数据的采集与标注非常耗时且昂贵。此外,出于隐私与安全考虑,某些应用(如涉及医疗领域的应用)无法收集大量标注数据。自训练、协同训练与自集成方法是三类可用于利用未标注数据的半监督学习方法。本文中,我们提出基于自集成的深度学习模型,其结合有限标注数据,利用未标注数据提升泛化性能。我们在软生物特征性别与年龄分类上评估了所提基于自集成的深度学习模型。在 CelebA 与 VISOB 数据集上的实验评估表明,仅使用 1000 个标注样本、其余 199k 样本作为未标注样本(CelebA 数据集),以及类似地 1000 个标注样本、其余 107k 样本作为未标注样本(VISOB 数据集),性别分类准确率分别为 94.46% 与 81.00%。对比评估表明,与在整个 CelebA 与 VISOB 数据集上训练的监督模型相比,自集成模型的准确率分别提升了 5.74%5.74\%8.47%8.47\%。我们还在 Adience 数据集上评估了所提学习方法用于年龄组预测,其优于基线监督深度学习模型,精确准确率为 55.55 ±\pm 4.28,比基线高 3.92%。

关键词

引用

@article{arxiv.2110.04427,
  title  = {Harnessing Unlabeled Data to Improve Generalization of Biometric Gender and Age Classifiers},
  author = {Aakash Varma Nadimpalli and Narsi Reddy and Sreeraj Ramachandran and Ajita Rattani},
  journal= {arXiv preprint arXiv:2110.04427},
  year   = {2021}
}

备注

7 pages, 5 figures, 5 tables