面向细粒度图像分类的生成对抗网络与面部关键点检测方法
计算机视觉与模式识别
2021-09-03 v1
摘要
细粒度分类仍是一项具有挑战性的任务,因为区分类别需要学习复杂且局部性的差异。图像中物体在姿态、尺度和位置上的多样性使该问题更加困难。尽管近期的 Vision Transformer 模型取得了高性能,但其需要大量的输入数据。为应对此问题,我们充分利用基于 GAN 的数据增强来生成额外的数据集样本。Oxford-IIIT Pets 是我们本实验所选的数据集。它包含37种猫狗品种,且在尺度、姿态和光照上存在变化,这加剧了分类任务的难度。此外,我们增强了近期的生成对抗网络(GAN)——StyleGAN2-ADA 模型,以生成更逼真的图像,同时防止对训练集过拟合。我们通过训练一个定制版的 MobileNetV2 来预测动物面部关键点,随后据此裁剪图像来实现这一点。最后,我们将合成图像与原始数据集结合,并将我们提出的方法与标准 GAN 增强及无增强在不同训练数据子集下进行比较。我们通过评估近期 Vision Transformer (ViT) 模型上的细粒度图像分类准确率来验证我们的工作。
引用
@article{arxiv.2109.00891,
title = {Towards Fine-grained Image Classification with Generative Adversarial Networks and Facial Landmark Detection},
author = {Mahdi Darvish and Mahsa Pouramini and Hamid Bahador},
journal= {arXiv preprint arXiv:2109.00891},
year = {2021}
}
备注
Submitted to International Conference on Machine Vision and Image Processing (MVIP), 2022