用于视听情感模仿强度估计的高效特征提取与后期融合策略
多媒体
2024-03-21 v2 机器学习
声音
音频与语音处理
摘要
本文提出了一种针对情感模仿强度(EMI)估计挑战赛的解决方案,该挑战赛是第六届自然场景情感行为分析(ABAW)竞赛的一部分。EMI 估计挑战赛的任务旨在通过从一组预定义的情绪类别(即“钦佩”、“逗趣”、“决心”、“共情痛苦”、“兴奋”和“喜悦”)对种子视频进行评估,以评价其情绪强度。为应对这一挑战,我们基于 ResNet18 和 AUs 为视频模态提取了丰富的双通道视觉特征,并基于 Wav2Vec2.0 为音频模态提取了有效的单通道特征。这使我们能够获得视听模态的全面情绪特征。此外,利用后期融合策略,我们对视觉模型和声学模型的预测取平均值,从而实现了更准确的视听情感模仿强度估计。实验结果验证了我们方法的有效性,在验证集上 6 个情绪维度的平均皮尔逊相关系数()达到了 0.3288。
引用
@article{arxiv.2403.11757,
title = {Efficient Feature Extraction and Late Fusion Strategy for Audiovisual Emotional Mimicry Intensity Estimation},
author = {Jun Yu and Wangyuan Zhu and Jichao Zhu},
journal= {arXiv preprint arXiv:2403.11757},
year = {2024}
}