中文

MMSD3.0:面向真实场景的多图像多模态讽刺检测基准

计算机视觉与模式识别 2026-03-02 v2 多媒体

摘要

尽管多模态讽刺检测取得了进展,现有数据集和方法主要关注单图像场景,忽略了潜在的跨多个图像的语义和情感关系。这在真实场景下以多图像线索触发讽刺的情况中留下了空白。为弥合这一空白,我们引入了 MMSD3.0,一个完全由多图像样本构成的新基准,数据来源于推文和亚马逊评论。我们进一步提出了跨图像推理模型(CIRM),其进行针对性的跨图像序列建模,以捕获潜在的图像间联系。此外,我们引入了基于文本-图像对应关系的相关性引导的细粒度跨模态融合机制,以减少集成过程中的信息损失。我们构建了一套全面的强大且具代表性的基线,并开展了大量实验,表明 MMSD3.0 是一个有效可靠的基准,更能反映真实世界条件。此外,CIRM 在 MMSD、MMSD2.0 和 MMSD3.0 上均实现了最先进的性能,验证了其在单图像和多图像场景中的有效性。数据集和代码已公开提供于 https://github.com/ZHCMOONWIND/MMSD3.0。

关键词

引用

@article{arxiv.2510.23299,
  title  = {MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection},
  author = {Haochen Zhao and Yuyao Kong and Yongxiu Xu and Gaopeng Gou and Hongbo Xu and Yubin Wang and Haoliang Zhang},
  journal= {arXiv preprint arXiv:2510.23299},
  year   = {2026}
}