基于迁移学习与数据增强的 Vision Transformer 口罩使用识别
计算机视觉与模式识别
2022-03-23 v1 机器学习
摘要
COVID-19 大流行已扰乱社会各层面。通过使用口罩的人像识别来防止 COVID-19 传播,口罩的使用至关重要。尽管仅 23.1% 的人正确佩戴口罩,人工神经网络(ANN)仍可帮助分类规范口罩使用以减缓 Covid-19 病毒传播。然而,训练能正确分类口罩使用情况的 ANN 需要大型数据集。MaskedFace-Net 是一个合适的数据集,包含 137016 张数字图像,具 4 类标签:Mask、Mask Chin、Mask Mouth Chin 与 Mask Nose Mouth。口罩分类训练利用 Vision Transformers (ViT) 架构,采用在 ImageNet-21k 上预训练的权重进行迁移学习,并辅以随机增强。此外,训练超参数为 20 轮 epoch、学习率 0.03 的随机梯度下降(SGD)优化器、批次大小 64、高斯累积分布(GeLU)激活函数与交叉熵损失函数,应用于三种 ViT 架构即 Base-16、Large-16 与 Huge-14 的训练。此外,进行了带与不带增强和迁移学习的对比。本研究发现最佳分类为使用 ViT Huge-14 的迁移学习与增强。在 MaskedFace-Net 数据集上,该研究在训练数据上达 0.9601 准确率、验证数据 0.9412、测试数据 0.9534。本研究表明,即便优于基于卷积的残差网络(ResNet),以数据增强与迁移学习训练 ViT 模型也提升了口罩使用分类。
引用
@article{arxiv.2203.11542,
title = {Mask Usage Recognition using Vision Transformer with Transfer Learning and Data Augmentation},
author = {Hensel Donato Jahja and Novanto Yudistira and Sutrisno},
journal= {arXiv preprint arXiv:2203.11542},
year = {2022}
}