中文

基于关系时序图神经网络与辅助跨模态交互的对话理解

计算与语言 2024-01-31 v3 多媒体

摘要

情感识别是人机对话理解中的一项关键任务。随着多模态数据(如语言、语音和面部表情)的引入,该任务变得更具挑战性。作为一种典型解决方案,全局与局部上下文信息被用于预测对话中每一单独句子(即话语)的情感标签。具体而言,全局表示可通过在对话层面建模跨模态交互来捕获;局部表示常利用说话者的时间信息或情感转移来推断,这忽略了话语层面的关键因素。此外,多数现有方法在统一输入中采用多模态融合特征,而未利用模态特定表示。受这些问题启发,我们提出了带有辅助跨模态交互的关系时序图神经网络(CORECT),一种新颖的神经网络框架,它以模态特定的方式有效捕获对话级跨模态交互与话语级时序依赖,用于对话理解。大量实验表明,CORECT 在 IEMOCAP 和 CMU-MOSEI 数据集的多模态 ERC 任务上取得了最先进结果,证明了其有效性。

关键词

引用

@article{arxiv.2311.04507,
  title  = {Conversation Understanding using Relational Temporal Graph Neural Networks with Auxiliary Cross-Modality Interaction},
  author = {Cam-Van Thi Nguyen and Anh-Tuan Mai and The-Son Le and Hai-Dang Kieu and Duc-Trong Le},
  journal= {arXiv preprint arXiv:2311.04507},
  year   = {2024}
}

备注

EMNLP 2023