MIMIC:用于面部表情识别的掩码图像预训练与混合对比微调
计算机视觉与模式识别
2024-01-17 v1
摘要
面部表情识别(FER)的前沿研究目前倾向于使用在面部识别数据集上监督预训练的卷积神经网络(CNN)骨干进行特征提取。然而,由于面部识别数据集规模庞大且收集面部标签成本高昂,这种预训练范式代价巨大。为此,我们提出在中等规模通用图像数据集上通过自监督方法预训练视觉Transformer(ViT)。此外,与面部数据集和FER数据集之间的领域差异相比,通用数据集与FER数据集之间的差异更为显著。因此,我们提出一种对比微调方法以有效缓解这种领域差异。具体而言,我们引入了一种新的FER训练范式,称为掩码图像预训练与混合对比微调(MIMIC)。在初始阶段,我们在通用图像上通过掩码图像重建预训练ViT。随后,在微调阶段,我们引入混合监督对比学习过程,通过混合策略为模型提供更广泛的正样本。通过在三个基准数据集上进行的大量实验,我们证明MIMIC优于之前的训练范式,展示了其学习更好表示的能力。值得注意的是,结果表明,普通ViT无需复杂辅助模块即可实现令人印象深刻的性能。此外,当扩大模型规模时,MIMIC未出现性能饱和,且优于当前最先进的方法。
引用
@article{arxiv.2401.07245,
title = {MIMIC: Mask Image Pre-training with Mix Contrastive Fine-tuning for Facial Expression Recognition},
author = {Fan Zhang and Xiaobao Guo and Xiaojiang Peng and Alex Kot},
journal= {arXiv preprint arXiv:2401.07245},
year = {2024}
}