中文

MAVEN:面向价值- arousal 情绪的多模态注意力网络

机器学习 2025-05-05 v2 人工智能 计算机视觉与模式识别 多媒体

摘要

野外动态情绪识别由于情绪表达的瞬时性质以及多模态线索的时间错位,仍然具有挑战性。传统方法预测价值和 arousal,常常忽略这两个维度之间固有的相关性。提出的 Multi-modal Attention for Valence-Arousal Emotion Network (MAVEN) 通过双向跨模态注意力机制整合视觉、音频和文本三种模态。MAVEN 使用特定于模态的编码器从同步的视频帧、音频片段和 transcript 中提取特征,按照Russell的圆周模型预测情绪,以极坐标表示。对 Aff-Wild2 数据集使用 MAVEN 进行评估,达到了0.3061的 concordance correlation coefficient (CCC),超过ResNet-50基线模型的0.22的 CCC。该多阶段架构捕捉对话视频中情绪表达的细微和瞬时特性,提高了在真实世界情境下的情绪识别。代码可在 https://github.com/Vrushank-Ahire/MAVEN_8th_ABAW 获取。

关键词

引用

@article{arxiv.2503.12623,
  title  = {MAVEN: Multi-modal Attention for Valence-Arousal Emotion Network},
  author = {Vrushank Ahire and Kunal Shah and Mudasir Nazir Khan and Nikhil Pakhale and Lownish Rai Sookha and M. A. Ganaie and Abhinav Dhall},
  journal= {arXiv preprint arXiv:2503.12623},
  year   = {2025}
}