中文

探索音视频情感识别中的情感特征与融合策略

计算机视觉与模式识别 2020-12-29 v1

摘要

基于音视频的情感识别旨在将给定的视频分类为基本情感。本文描述了我们在 EmotiW 2019 中的方法,主要探索音频与视觉模态的情感特征及特征融合策略。对于情感特征,我们探索了兼具语音谱图和 Log Mel 谱图的音频特征,并用不同 CNN 模型及不同情感预训练策略评估了若干人脸特征。对于融合策略,我们探索了模态内与跨模态融合方法,例如设计注意力机制以突出重要情感特征,探索特征拼接与因子化双线性池化(FBP)用于跨模态特征融合。经细致评估,我们在 AFEW 验证集上取得 65.5%、测试集上取得 62.48%,并在该挑战赛中排名第三。

关键词

引用

@article{arxiv.2012.13912,
  title  = {Exploring Emotion Features and Fusion Strategies for Audio-Video Emotion Recognition},
  author = {Hengshun Zhou and Debin Meng and Yuanyuan Zhang and Xiaojiang Peng and Jun Du and Kai Wang and Yu Qiao},
  journal= {arXiv preprint arXiv:2012.13912},
  year   = {2020}
}

备注

Accepted by ACM ICMI'19 (2019 International Conference on Multimodal Interaction)