中文

MiVOLO:用于年龄与性别估计的多输入 Transformer

计算机视觉与模式识别 2023-09-25 v2 人工智能 机器学习

摘要

真实场景下的年龄与性别识别是一项极具挑战性的任务:除了条件多变、姿态复杂以及图像质量参差不齐外,还存在面部部分或完全被遮挡的情况。我们提出 MiVOLO(Multi Input VOLO),一种利用最新视觉 Transformer 进行年龄与性别估计的简洁方法。我们的方法将两项任务整合为一个统一的双输入/输出模型,不仅利用面部信息,还利用人体图像数据。这提升了模型的泛化能力,使其即便在图像中面部不可见时也能给出满意结果。为评估所提模型,我们在四个流行基准上开展实验,取得了 SOTA 性能,同时展现了实时处理能力。此外,我们基于 Open Images Dataset 的图像引入了一个新的基准。该基准的 ground truth 标注由人工标注者精心生成,并通过投票的智能聚合获得了高准确度的答案。进一步,我们将模型的年龄识别性能与人工水平准确度进行比较,表明其在大多数年龄区间内显著优于人类。最后,我们公开了模型以及用于验证和推理的代码。另外,我们为所用数据集提供了额外标注并引入了新基准。

关键词

引用

@article{arxiv.2307.04616,
  title  = {MiVOLO: Multi-input Transformer for Age and Gender Estimation},
  author = {Maksim Kuprashevich and Irina Tolstykh},
  journal= {arXiv preprint arXiv:2307.04616},
  year   = {2023}
}

备注

For the project repository, please visit: https://github.com/WildChlamydia/MiVOLO