用于维度情感识别的混合多模态融合
摘要
在本文中,我们全面介绍了我们针对 2021 年多模态情感挑战赛(MuSe)的 MuSe-Stress 子挑战和 MuSe-Physio 子挑战的解决方案。MuSe-Stress 子挑战的目标是从视听记录中以时间连续的方式预测情感唤醒度和效价的水平,而 MuSe-Physio 子挑战的目标是根据以下两方面预测心理生理唤醒水平:a) 人类标注,融合 b) 来自受压人员的皮肤电反应(也称为皮电活动(EDA))信号。两个子挑战均使用了 Ulm-TSST 数据集,这是一个视听文本 Ulm-Trier 社会压力数据集的新子集,其特色是在 Trier 社会压力测试(TSST)诱发的压力情境下记录的德语说话者。对于 MuSe-Stress 子挑战,我们从三个方面突出了我们的解决方案:1) 使用视听特征和生物信号特征进行情感状态识别。2) 利用带有自注意力机制的 Long Short-Term Memory (LSTM) 来捕捉特征序列内复杂的时序依赖关系。3) 采用后期融合策略,通过利用分散在多模态序列中的互补信息进一步提升模型的识别性能。我们提出的模型在测试集上对效价和唤醒度的 CCC 分别达到了 0.6159 和 0.4609,两者均排名前三。对于 MuSe-Physio 子挑战,我们首先从多种模态中提取视听特征和生物信号特征。然后,利用带有自注意力机制的 LSTM 模块、Gated Convolutional Neural Networks (GCNN) 以及 LSTM 网络对序列中复杂的时序依赖关系进行建模。最后,使用了后期融合策略。我们提出的方法在测试集上也达到了 0.5412 的 CCC,排名前三。
引用
@article{arxiv.2110.08495,
title = {Hybrid Mutimodal Fusion for Dimensional Emotion Recognition},
author = {Ziyu Ma and Fuyan Ma and Bin Sun and Shutao Li},
journal= {arXiv preprint arXiv:2110.08495},
year = {2021}
}
备注
8 pages, 2 figures, accepted by ACM MM2021