中文

对话中基于情感增强图的讽刺解释

计算与语言 2025-01-07 v2 多媒体

摘要

对话讽刺解释(SED)是一项新颖但具有挑战性的任务,其目标是为给定的涉及多模态(即话语、视频和音频)的讽刺性对话生成自然语言解释。尽管现有研究基于生成式预训练语言模型BART取得了巨大成功,但它们忽略了利用存在于话语、视频和音频中的情感,这些情感在反映本质上涉及微妙情感对比的讽刺中起着重要作用。然而,由于三个主要挑战,融入情感以提升SED性能并非易事:1)话语标记对情感的多样化影响;2)视频-音频情感信号与BART嵌入空间之间的差距;以及3)话语、话语情感和视频-音频情感之间的各种关系。为应对这些挑战,我们提出了一种新颖的基于情感增强图的多模态讽刺解释框架,名为EDGE。具体而言,我们首先提出了一个词典引导的话语情感推断模块,其中设计了一种启发式话语情感细化策略。然后,我们通过扩展多模态情感分析模型JCA,开发了一个名为联合交叉注意力情感推断(JCA-SI)的模块,以推导出每个视频-音频片段的联合情感标签。此后,我们设计了一个上下文-情感图,以全面建模话语、话语情感和视频-音频情感之间的语义关系,从而促进讽刺解释的生成。在公开数据集WITS上的大量实验验证了我们的模型相对于前沿方法的优越性。

关键词

引用

@article{arxiv.2402.03658,
  title  = {Sentiment-enhanced Graph-based Sarcasm Explanation in Dialogue},
  author = {Kun Ouyang and Liqiang Jing and Xuemeng Song and Meng Liu and Yupeng Hu and Liqiang Nie},
  journal= {arXiv preprint arXiv:2402.03658},
  year   = {2025}
}

备注

This paper got accepted by IEEE TMM