中文

AM^2-EmoJE:基于联合嵌入学习的对话中自适应缺失模态情感识别

人工智能 2024-02-20 v1 计算机视觉与模式识别 机器学习

摘要

人类情感可以通过不同模态呈现,即音频、视频和文本。然而,每种模态在展现每种情感时的贡献并不均匀。此外,在测试时,完整模态特定细节的可用性并不总能得到保证。在这项工作中,我们提出了AM^2-EmoJE,一种基于联合嵌入学习的对话中自适应缺失模态情感识别模型,该模型基于两方面的贡献:第一,一种查询自适应融合方法,能够以查询特定的方式自动学习其模态特定表示的相对重要性。通过这种方式,模型旨在优先考虑情感模式的模态不变空间查询细节,同时在学习的多模态查询描述符中保留其模态专属方面。第二,多模态联合嵌入学习模块,明确处理测试时的各种缺失模态场景。通过这种方式,模型学会强调跨模态的相关模式,这可能有助于在联合嵌入空间内成对地对齐交叉关注的模态特定描述符,从而在推理过程中补偿缺失的模态。通过利用对话级别的时空细节,所提出的AM^2-EmoJE不仅通过有效利用肢体语言替代面部表情,展现出优于最佳性能最先进多模态方法的性能,而且还具有增强的隐私特性。通过报告加权F1分数约2-5%的提升,所提出的多模态联合嵌入模块在测试时的各种缺失模态查询场景中促进了令人印象深刻的性能提升。

关键词

引用

@article{arxiv.2402.10921,
  title  = {AM^2-EmoJE: Adaptive Missing-Modality Emotion Recognition in Conversation via Joint Embedding Learning},
  author = {Naresh Kumar Devulapally and Sidharth Anand and Sreyasee Das Bhattacharjee and Junsong Yuan},
  journal= {arXiv preprint arXiv:2402.10921},
  year   = {2024}
}