中文

GDCNet:用于多模态讽刺检测的生成性差异比较网络

计算机视觉与模式识别 2026-01-29 v1 人工智能 计算与语言

摘要

多模态讽刺检测(MSD)旨在通过建模跨模态的语义不一致性来识别图像-文本对中的讽刺。现有方法常通过利用跨模态嵌入错位来检测不一致性,但在视觉和文本内容松散关联或语义间接时难以实现。虽然最近的研究方法利用大型语言模型(LLM)生成讽刺线索,但这些生成的本征多样性和主观性常会引入噪声。为此,本文提出生成性差异比较网络(GDCNet)。该框架通过利用来自多模态大型语言模型(MLLM)生成的、以事实为依据的图像描述作为稳定的语义锚点来捕获跨模态冲突。具体而言,GDCNet计算生成客观描述与原始文本之间的语义和情感差异,同时衡量视觉-文本保真度。这些差异特征随后通过门控模块与视觉和文本表示融合,以自适应平衡各模态的贡献。广泛的实验表明,GDCNet在MSD基准测试上表现出卓越的准确性和鲁棒性,为MMSD2.0基准测试建立了新的最佳性能。

关键词

引用

@article{arxiv.2601.20618,
  title  = {GDCNet: Generative Discrepancy Comparison Network for Multimodal Sarcasm Detection},
  author = {Shuguang Zhang and Junhong Lian and Guoxin Yu and Baoxun Xu and Xiang Ao},
  journal= {arXiv preprint arXiv:2601.20618},
  year   = {2026}
}

备注

Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)