中文

平衡人脸数据集:引导StyleGAN生成用于代表性不足群体的标注合成人脸图像数据集

计算机视觉与模式识别 2023-08-08 v1 人工智能 机器学习

摘要

为使机器学习模型在特定问题域内对未见数据有效泛化,众所周知数据需具备足够规模并代表真实场景。然而,真实世界数据集常存在过度代表与代表不足的群体。缓解机器学习偏差的一个方案是利用多样且具代表性的数据集。在覆盖所有人口统计群体的数据集上训练模型,对减少机器学习中的偏差至关重要。然而,收集与标注大规模数据集一直具有挑战性,促使人们使用合成数据生成与主动标注来降低人工标注成本。本研究的重点是利用StyleGAN模型生成鲁棒的人脸图像数据集。为在不同人口统计群体间实现数据集的平衡分布,通过控制StyleGAN的生成过程创建合成数据集,并为不同下游任务进行标注。

关键词

引用

@article{arxiv.2308.03495,
  title  = {Balanced Face Dataset: Guiding StyleGAN to Generate Labeled Synthetic Face Image Dataset for Underrepresented Group},
  author = {Kidist Amde Mekonnen},
  journal= {arXiv preprint arXiv:2308.03495},
  year   = {2023}
}

备注

7 pages, 7 figures,submitted to AMLD Africa 2021 conference