中文

面向音视频情感识别的细节增强模态内与模态间交互

计算机视觉与模式识别 2024-05-28 v1

摘要

捕捉视频和音频模态之间的复杂时间关系对于音视频情感识别(AVER)至关重要。然而,现有方法缺乏对局部细节的关注,例如视频帧之间的面部状态变化,这可能会降低特征的判别性,从而降低识别准确率。在本文中,我们提出了一种用于AVER的细节增强模态内与模态间交互网络(DE-III),该网络融合了若干新颖之处。我们引入光流信息来丰富视频表示,使其包含能更好捕捉面部状态变化的纹理细节。一个融合模块将光流估计与相应的视频帧集成,以增强面部纹理变化的表示。我们还设计了注意力模态内和模态间特征增强模块,以进一步提高视频和音频表示的丰富性和判别性。详细的定量评估表明,我们提出的模型在三个基准数据集上,针对具体情感和连续情感识别任务均优于所有现有方法。为鼓励进一步研究并确保可复现性,我们将在论文被接收后发布完整代码。

关键词

引用

@article{arxiv.2405.16701,
  title  = {Detail-Enhanced Intra- and Inter-modal Interaction for Audio-Visual Emotion Recognition},
  author = {Tong Shi and Xuri Ge and Joemon M. Jose and Nicolas Pugeault and Paul Henderson},
  journal= {arXiv preprint arXiv:2405.16701},
  year   = {2024}
}

备注

Submitted to 27th International Conference of Pattern Recognition (ICPR 2024)