中文

用于视听情感模仿强度估计的高效特征提取与后期融合策略

多媒体 2024-03-21 v2 机器学习 声音 音频与语音处理

摘要

本文提出了一种针对情感模仿强度(EMI)估计挑战赛的解决方案,该挑战赛是第六届自然场景情感行为分析(ABAW)竞赛的一部分。EMI 估计挑战赛的任务旨在通过从一组预定义的情绪类别(即“钦佩”、“逗趣”、“决心”、“共情痛苦”、“兴奋”和“喜悦”)对种子视频进行评估,以评价其情绪强度。为应对这一挑战,我们基于 ResNet18 和 AUs 为视频模态提取了丰富的双通道视觉特征,并基于 Wav2Vec2.0 为音频模态提取了有效的单通道特征。这使我们能够获得视听模态的全面情绪特征。此外,利用后期融合策略,我们对视觉模型和声学模型的预测取平均值,从而实现了更准确的视听情感模仿强度估计。实验结果验证了我们方法的有效性,在验证集上 6 个情绪维度的平均皮尔逊相关系数(ρ\rho)达到了 0.3288。

关键词

引用

@article{arxiv.2403.11757,
  title  = {Efficient Feature Extraction and Late Fusion Strategy for Audiovisual Emotional Mimicry Intensity Estimation},
  author = {Jun Yu and Wangyuan Zhu and Jichao Zhu},
  journal= {arXiv preprint arXiv:2403.11757},
  year   = {2024}
}