中文

面向情感分析的多模态特征提取、挖掘与融合

计算机视觉与模式识别 2022-08-15 v2 计算与语言 声音 音频与语音处理 图像与视频处理

摘要

本文给出我们针对 2022 年多模态情感分析挑战赛(MuSe)的解决方案,该挑战赛包含 MuSe-Humor、MuSe-Reaction 与 MuSe-Stress 三个子挑战。MuSe 2022 聚焦于利用不同模态与数据集的幽默检测、情绪反应和多模态情绪压力。在我们的工作中,提取了包括声学、视觉、文本和生物学特征在内的多种多模态特征。这些特征通过 TEMMA 与带自注意力机制的 GRU 框架进行融合。本文中,1)为提升准确率提取了若干新的音频特征、面部表情特征与段落级文本嵌入。2)我们通过挖掘与混合多模态特征大幅提升了多模态情感预测的准确率与可靠性。3)在模型训练中应用了有效的数据增强策略,以缓解样本不均衡问题并防止模型学习到有偏的主体特征。在 MuSe-Humor 子挑战中,我们的模型取得 0.8932 的 AUC 分数。在 MuSe-Reaction 子挑战中,我们方法在测试集上的 Pearson 相关系数为 0.3879,优于所有其他参与者。在 MuSe-Stress 子挑战中,我们的方法在测试集的唤醒度与效价上均优于基线,最终综合结果达到 0.5151。

关键词

引用

@article{arxiv.2208.03051,
  title  = {Hybrid Multimodal Feature Extraction, Mining and Fusion for Sentiment Analysis},
  author = {Jia Li and Ziyang Zhang and Junjie Lang and Yueqi Jiang and Liuwei An and Peng Zou and Yangyang Xu and Sheng Gao and Jie Lin and Chunxiao Fan and Xiao Sun and Meng Wang},
  journal= {arXiv preprint arXiv:2208.03051},
  year   = {2022}
}

备注

8 pages, 2 figures, to appear in MuSe 2022 (ACM MM2022 co-located workshop)