中文

通过图像描述提取增强的多层次跨模态语义不一致表示用于多模态讽刺检测

计算机视觉与模式识别 2024-08-06 v1 人工智能

摘要

讽刺是一种讽刺,表现为字面解释与意图含义之间的内在不匹配。尽管文本讽刺检测已广泛研究,但在某些情况下,仅凭文本输入可能不足以感知讽刺。将额外的上下文线索(如图像)纳入进来对于有效识别社交媒体数据中的讽刺至关重要。本研究提出了一种新的多模态讽刺检测框架,可处理输入三元组。这三个组件中两个由输入文本及其关联图像组成,正如数据集中所示。此外,引入一种补充模态形式为描述性图像标题。将其纳入视觉语义表示的动机是更准确地捕捉文本和视觉内容之间的差异,这是讽刺检测任务的基本要素。本研究的主要贡献包括:(1) 利用跨语言语言模型的鲁棒文本特征提取分支;(2) 集成轻量级空间感知注意力模块的自调节残差卷积网络用于视觉特征提取分支;(3) 采用编码器-解码器架构生成的图像标题作为额外模态,能够读取图像中嵌入的文本;(4) 针对文本与两种层次图像表示之间的不一致,设计不同的注意力模块;(5) 通过特征融合实现多层次跨域语义不一致表示。与当前最先进的基线方法相比,所提出的模型在 Twitter 多模态讽刺数据集和 MultiBully 数据集上分别实现了最高的 92.89% 和 64.48% 准确率。

关键词

引用

@article{arxiv.2408.02595,
  title  = {Modelling Visual Semantics via Image Captioning to extract Enhanced Multi-Level Cross-Modal Semantic Incongruity Representation with Attention for Multimodal Sarcasm Detection},
  author = {Sajal Aggarwal and Ananya Pandey and Dinesh Kumar Vishwakarma},
  journal= {arXiv preprint arXiv:2408.02595},
  year   = {2024}
}