中文

MMGCN:基于深度图卷积网络的多模态融合用于对话中的情绪识别

计算与语言 2021-07-15 v1 声音 音频与语音处理

摘要

对话中的情绪识别(ERC)是情感对话系统的关键组成部分,它帮助系统理解用户情绪并生成共情回应。然而,大多数工作主要关注于基于文本模态建模说话人与上下文信息,或仅通过特征拼接简单利用多模态信息。为探索一种更有效的利用多模态与长距离上下文信息的方式,我们在本工作中提出了一种基于多模态融合图卷积网络的新模型 MMGCN。MMGCN 不仅能有效利用多模态依赖,还能借助说话人信息建模说话人之间与说话人内部的依赖。我们在两个公开基准数据集 IEMOCAP 和 MELD 上评估了所提模型,结果证明了 MMGCN 的有效性,在多模态对话设定下以显著优势优于其他 SOTA 方法。

关键词

引用

@article{arxiv.2107.06779,
  title  = {MMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in Conversation},
  author = {Jingwen Hu and Yuchen Liu and Jinming Zhao and Qin Jin},
  journal= {arXiv preprint arXiv:2107.06779},
  year   = {2021}
}