中文

MVP:基于视频和生理信号的多模态情感识别

计算机视觉与模式识别 2025-01-07 v1

摘要

人类情感涉及一系列复杂的行为、生理和认知变化。当前的前沿模型使用经典机器学习方法而非最新的深度学习技术来融合行为和生理成分。我们提出填补这一空白,设计了一种用于视频和生理信号融合的多模态视频和生理(MVP)架构。与其他方法不同,MVP利用注意力机制,使能够使用较长的输入序列(1-2分钟)。我们研究了视频和生理信号的 backbone 以处理长序列输入,并对照前沿方法对我们的方法进行评估。我们的结果表明,MVP 在基于面部视频、EDA、ECG/PPG 的情感识别方面优于以前的方法。

关键词

引用

@article{arxiv.2501.03103,
  title  = {MVP: Multimodal Emotion Recognition based on Video and Physiological Signals},
  author = {Valeriya Strizhkova and Hadi Kachmar and Hava Chaptoukaev and Raphael Kalandadze and Natia Kukhilava and Tatia Tsmindashvili and Nibras Abo-Alzahab and Maria A. Zuluaga and Michal Balazia and Antitza Dantcheva and François Brémond and Laura Ferrari},
  journal= {arXiv preprint arXiv:2501.03103},
  year   = {2025}
}

备注

Preprint. Final paper accepted at Affective Behavior Analysis in-the-Wild (ABAW) at IEEE/CVF European Conference on Computer Vision (ECCV), Milan, September, 2024. 17 pages