中文

面向真实场景情感识别的特征级与模型级音视频融合

计算机视觉与模式识别 2019-06-07 v1

摘要

情感识别在人机交互(HCI)中起着重要作用,并已被广泛研究数十年。尽管在摆姿表情方面取得了巨大进展,但在“接近真实世界”的环境中识别人类情感仍然是一项挑战。在本文中,我们提出了两种策略来融合从音频和视觉等不同模态提取的信息。具体而言,我们利用 LBP-TOP、CNN 集成和双向 LSTM(BLSTM)从视觉通道提取特征,并利用 OpenSmile 工具包从音频通道提取特征。我们开发了两类融合方法,即特征级融合和模型级融合,以利用从两个通道提取的信息。在 EmotiW2018 AFEW 数据集上的实验结果表明,所提出的融合方法显著优于基线方法,并与最先进(SOTA)方法相比取得更好或至少相当的性能,其中当某一通道完全失效时模型级融合表现更好。

关键词

引用

@article{arxiv.1906.02728,
  title  = {Feature-level and Model-level Audiovisual Fusion for Emotion Recognition in the Wild},
  author = {Jie Cai and Zibo Meng and Ahmed Shehab Khan and Zhiyuan Li and James O'Reilly and Shizhong Han and Ping Liu and Min Chen and Yan Tong},
  journal= {arXiv preprint arXiv:1906.02728},
  year   = {2019}
}