基于Swin Transformer的面部表情识别
计算机视觉与模式识别
2022-03-28 v1 人工智能
摘要
识别人类面部表情的任务在包括医疗和健康在内的各种与人相关的系统中起着至关重要的作用。随着深度学习近期的成功以及大量标注数据的可获取,面部表情识别研究已足够成熟,可在具有音视频数据集的真实场景中使用。本文中,我们针对Aff-Wild2表情数据集这一野外音视频数据集,引入基于Swin transformer的面部表情方法。具体而言,我们采用三流网络(即视觉流、时间流和音频流)处理音视频视频,将多模态信息融合到面部表情识别中。在Aff-Wild2数据集上的实验结果表明了我们提出的多模态方法的有效性。
引用
@article{arxiv.2203.13472,
title = {Facial Expression Recognition with Swin Transformer},
author = {Jun-Hwa Kim and Namho Kim and Chee Sun Won},
journal= {arXiv preprint arXiv:2203.13472},
year = {2022}
}