基于Transformer融合网络与动态采样的多模态面部表情识别
计算机视觉与模式识别
2023-03-21 v2
摘要
面部表情识别在情绪检测、心理健康分析和人机交互等多种应用中是一项重要任务。本文提出一种多模态面部表情识别方法,利用音频信息与面部图像,为区分某些模糊面部表情提供关键线索。具体而言,我们引入模态融合模块(MFM)来融合视听信息,其中图像与音频特征由Swin Transformer提取。此外,我们通过采用动态数据重采样来解决数据集中的不平衡问题。我们的模型已在CVPR 2023的野外情感行为(ABAW)挑战赛中得到评估。
引用
@article{arxiv.2303.08419,
title = {Multi Modal Facial Expression Recognition with Transformer-Based Fusion Networks and Dynamic Sampling},
author = {Jun-Hwa Kim and Namho Kim and Chee Sun Won},
journal= {arXiv preprint arXiv:2303.08419},
year = {2023}
}