基于最优传输的多模态学习用于讽刺与幽默检测
计算机视觉与模式识别
2021-10-22 v1
摘要
多模态学习是一个新兴但具挑战性的研究领域。在本文中,我们处理来自对话视频和图像-文本对的讽刺与幽默多模态检测。作为一种 fleeting 动作,且跨模态反映,讽刺检测具有挑战性,因为文献中该任务缺乏大型数据集。因此,我们主要关注资源受限训练,即训练样本数量有限。为此,我们提出了一种新颖的多模态学习系统 MuLOT(基于最优传输的多模态学习),其利用自注意力挖掘模态内对应性,并利用最优传输挖掘模态间对应性。最后,通过多模态注意力融合将各模态结合以捕获跨模态的相互依赖。我们在三个基准数据集——MUStARD(视频、音频、文本)、UR-FUNNY(视频、音频、文本)、MST(图像、文本)——上测试了我们的多模态讽刺与幽默检测方法,并分别取得比 SOTA 高 2.1%、1.54% 和 2.34% 的准确率提升。
引用
@article{arxiv.2110.10949,
title = {Multimodal Learning using Optimal Transport for Sarcasm and Humor Detection},
author = {Shraman Pramanick and Aniket Roy and Vishal M. Patel},
journal= {arXiv preprint arXiv:2110.10949},
year = {2021}
}
备注
Accepted to WACV 2022