重新审视对话多模态情感识别中模态与上下文的解耦与融合
计算与语言
2023-08-15 v2
摘要
使机器在对话场景下的多模态语境中理解人类情感已成为热门研究课题,其任务为对话中的多模态情感分析(MM-ERC)。MM-ERC 近年来持续受到关注,已有多种方法被提出以获取更好的任务性能。大多数现有工作将 MM-ERC 视为标准多模态分类问题,并进行多模态特征解耦与融合以最大化特征效用。然而在重新审视 MM-ERC 的特性后,我们认为特征的多模态性与对话上下文性应在特征解耦与融合步骤中同时被恰当建模。本工作中,我们旨在通过充分考虑上述洞见进一步推高任务性能。一方面,在特征解耦阶段,基于对比学习技术,我们设计了双层级解耦机制(DDM)将特征解耦至模态空间与话语空间。另一方面,在特征融合阶段,我们提出贡献感知融合机制(CFM)与上下文再融合机制(CRM)分别用于多模态与上下文整合。它们共同调度多模态与上下文特征的正确整合。具体而言,CFM 显式动态管理多模态特征贡献,而 CRM 灵活协调对话上下文的引入。在两个公开 MM-ERC 数据集上,我们的系统一致取得新的 SOTA 性能。进一步分析表明,我们提出的所有机制通过自适应充分利用多模态与上下文特征极大促进了 MM-ERC 任务。需注意,我们提出的方法有极大潜力促进更广范围的其它对话多模态任务。
引用
@article{arxiv.2308.04502,
title = {Revisiting Disentanglement and Fusion on Modality and Context in Conversational Multimodal Emotion Recognition},
author = {Bobo Li and Hao Fei and Lizi Liao and Yu Zhao and Chong Teng and Tat-Seng Chua and Donghong Ji and Fei Li},
journal= {arXiv preprint arXiv:2308.04502},
year = {2023}
}
备注
Accepted by ACM MM 2023