中文

基于Transformer融合网络与动态采样的多模态面部表情识别

计算机视觉与模式识别 2023-03-21 v2

摘要

面部表情识别在情绪检测、心理健康分析和人机交互等多种应用中是一项重要任务。本文提出一种多模态面部表情识别方法,利用音频信息与面部图像,为区分某些模糊面部表情提供关键线索。具体而言,我们引入模态融合模块(MFM)来融合视听信息,其中图像与音频特征由Swin Transformer提取。此外,我们通过采用动态数据重采样来解决数据集中的不平衡问题。我们的模型已在CVPR 2023的野外情感行为(ABAW)挑战赛中得到评估。

关键词

引用

@article{arxiv.2303.08419,
  title  = {Multi Modal Facial Expression Recognition with Transformer-Based Fusion Networks and Dynamic Sampling},
  author = {Jun-Hwa Kim and Namho Kim and Chee Sun Won},
  journal= {arXiv preprint arXiv:2303.08419},
  year   = {2023}
}