中文

MM-DFN:用于对话中情绪识别的多模态动态融合网络

计算与语言 2022-03-07 v1 人工智能 多媒体

摘要

对话中的情绪识别(ERC)在开发共情机器方面具有可观前景。对于多模态ERC,理解对话上下文并融合模态信息至关重要。近期基于图的融合方法通常通过在一个图中探索单模态与跨模态交互来聚合多模态信息。然而,它们在每一层累积冗余信息,限制了模态间的上下文理解。本文提出一种新颖的多模态动态融合网络(MM-DFN),通过充分理解多模态对话上下文来识别情绪。具体而言,我们设计了一个新的基于图的动态融合模块,以融合对话中的多模态上下文特征。该模块通过在不同语义空间中捕获上下文信息的动态性,减少了模态间的冗余并增强了互补性。在两个公开基准数据集上的大量实验证明了MM-DFN的有效性与优越性。

关键词

引用

@article{arxiv.2203.02385,
  title  = {MM-DFN: Multimodal Dynamic Fusion Network for Emotion Recognition in Conversations},
  author = {Dou Hu and Xiaolong Hou and Lingwei Wei and Lianxin Jiang and Yang Mo},
  journal= {arXiv preprint arXiv:2203.02385},
  year   = {2022}
}

备注

Accepted by ICASSP 2022