中文

配备神经缩放器的 Vision Transformer 在面部表情识别任务上的应用

计算机视觉与模式识别 2022-04-06 v1

摘要

在真实场景条件下,面部表情识别常受到低质量数据以及不平衡、模糊标签的挑战。该领域已从基于 CNN 的方法获益良多;然而,CNN 模型在结构上存在难以观测远处面部区域的局限。作为补救,Transformer 以其全局感受野被引入视觉领域,但需要将输入空间尺寸调整至预训练模型以利用其强大的归纳偏置。我们在本文中提出疑问:使用确定性插值方法是否足以将低分辨率数据输入 Transformer。在本工作中,我们提出了一种新颖的训练框架——神经缩放器(Neural Resizer),以数据驱动的方式通过补偿信息和下采样来支持 Transformer,并使用平衡噪声与不平衡性的损失函数进行训练。实验表明,我们的 Neural Resizer 配合 F-PDLS 损失函数在总体上提升了 Transformer 变体的性能,并近乎达到最先进(state-of-the-art)性能。

关键词

引用

@article{arxiv.2204.02181,
  title  = {Vision Transformer Equipped with Neural Resizer on Facial Expression Recognition Task},
  author = {Hyeonbin Hwang and Soyeon Kim and Wei-Jin Park and Jiho Seo and Kyungtae Ko and Hyeon Yeo},
  journal= {arXiv preprint arXiv:2204.02181},
  year   = {2022}
}

备注

Accepted to IEEE ICASSP 2022