通过视觉Transformer生成扑克脸实现面部表情的情绪分离与识别
计算机视觉与模式识别
2024-10-11 v4
摘要
表征学习与特征解耦在面部表情识别(FER)领域引发了显著的研究兴趣。情绪标签固有的模糊性给常规监督表征学习方法带来挑战。此外,直接从面部表情图像学习到情绪标签的映射缺乏用于捕捉细粒度面部特征的显式监督信号。本文提出一种名为扑克脸视觉Transformer(Poker Face Vision Transformer, PF-ViT)的新型FER模型,以应对这些挑战。PF-ViT旨在无需成对图像的情况下,通过生成对应扑克脸,从静态面部图像中分离并识别与干扰无关的情绪。受面部动作编码系统启发,我们将表情脸视为个人扑克脸(即无情绪脸)上一组面部肌肉运动组合的结果。PF-ViT使用原始Vision Transformers,其组件首先在无情绪标签的大型面部表情数据集上作为掩码自编码器预训练,从而获得优异表征。随后,我们用GAN框架训练PF-ViT。训练期间,扑克脸生成的辅助任务促进了情绪与情绪无关成分间的解耦,引导FER模型整体捕捉有判别力的面部细节。定量与定性结果表明了方法的有效性,在四个流行FER数据集上超越最先进方法。
引用
@article{arxiv.2207.11081,
title = {Emotion Separation and Recognition from a Facial Expression by Generating the Poker Face with Vision Transformers},
author = {Jia Li and Jiantao Nie and Dan Guo and Richang Hong and Meng Wang},
journal= {arXiv preprint arXiv:2207.11081},
year = {2024}
}
备注
This paper has been accepted for publication in the IEEE Transactions on Computational Social Systems (TCSS)