MuVaC:面向对话中多模态讽刺理解的变分因果框架
计算与语言
2026-03-31 v2
摘要
社交平台上多模态对话中讽刺的存在,构成了理解网络内容真实意图的关键且具挑战性的任务。全面的讽刺分析需要两个关键方面:多模态讽刺检测(Multimodal Sarcasm Detection, MSD)和多模态讽刺解释(Multimodal Sarcasm Explanation, MuSE)。直观而言,检测行为是推理过程的结果,这一过程解释了讽刺的表达方式。当前研究主要聚焦于单一任务处理MSD或MuSE,甚至虽有部分研究尝试将两者整合,但常常忽视其内在的因果依赖关系。为弥合这一差距,我们提出MuVaC——一种变分因果推理框架,模拟人类认知机制以理解讽刺,实现稳健的多模态特征学习,以实现MSD与MuSE的联合优化。具体而言,我们首先从结构因果模型的角度建模MSD与MuSE,构建变分因果路径以定义联合优化目标。随后,我们设计一种“对齐后融合”方法以整合多模态特征,为讽刺检测和解释生成提供稳健的融合表示。最后,通过确保检测结果与解释之间的一致性,提升推理可信度。实验结果表明,MuVaC在公开数据集上显著优于现有方法,为理解多模态讽刺提供了新的视角。
引用
@article{arxiv.2601.20451,
title = {MuVaC: A Variational Causal Framework for Multimodal Sarcasm Understanding in Dialogues},
author = {Diandian Guo and Fangfang Yuan and Cong Cao and Xixun Lin and Chuan Zhou and Hao Peng and Yanan Cao and Yanbing Liu},
journal= {arXiv preprint arXiv:2601.20451},
year = {2026}
}
备注
12 pages, 7 figures. Accepted by WWW 2026