MMGCN:基于深度图卷积网络的多模态融合用于对话中的情绪识别
计算与语言
2021-07-15 v1 声音
音频与语音处理
摘要
对话中的情绪识别(ERC)是情感对话系统的关键组成部分,它帮助系统理解用户情绪并生成共情回应。然而,大多数工作主要关注于基于文本模态建模说话人与上下文信息,或仅通过特征拼接简单利用多模态信息。为探索一种更有效的利用多模态与长距离上下文信息的方式,我们在本工作中提出了一种基于多模态融合图卷积网络的新模型 MMGCN。MMGCN 不仅能有效利用多模态依赖,还能借助说话人信息建模说话人之间与说话人内部的依赖。我们在两个公开基准数据集 IEMOCAP 和 MELD 上评估了所提模型,结果证明了 MMGCN 的有效性,在多模态对话设定下以显著优势优于其他 SOTA 方法。
引用
@article{arxiv.2107.06779,
title = {MMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in Conversation},
author = {Jingwen Hu and Yuchen Liu and Jinming Zhao and Qin Jin},
journal= {arXiv preprint arXiv:2107.06779},
year = {2021}
}