InterCLIP-MEP:基于交互式 CLIP 和记忆增强预测器的多模态讽刺检测
计算与语言
2025-11-14 v7 人工智能
计算机视觉与模式识别
摘要
社交媒体中的讽刺常通过文本与图像的相互作用表达,对于情感分析与意图挖掘构成重大挑战。现有多模态讽刺检测方法表明过度依赖文本模态中的表面线索,难以准确辨别讽刺的细微文本-图像互动。为此,本文提出一种新型框架 InterCLIP-MEP。该框架集成了交互式 CLIP(InterCLIP),通过在每个编码器中嵌入跨模态信息来获取更丰富的跨模态表征,训练参数约为现有SOTA方法的20.6倍。此外,引入记忆增强预测器(Memory-Enhanced Predictor, MEP),其包含动态双通道记忆机制,在推理过程中捕获并保存测试样本中的有用知识,作为非参数分类器提升讽刺检测的鲁棒性。在MMSD、MMSD2.0和DocMSU数据集上进行大规模实验,InterCLIP-MEP实现了SOTA性能,具体而言,在MMSD2.0上准确率提升1.08个百分点,F1分数提升1.51个百分点。在分布迁移评估下,准确率达到73.96%,显著优于无记忆版本的近10个百分点及前一SOTA方法的15个百分点以上,显示出卓越的稳定性与适应性。InterCLIP-MEP的实现已公开于https://github.com/CoderChen01/InterCLIP-MEP。
引用
@article{arxiv.2406.16464,
title = {InterCLIP-MEP: Interactive CLIP and Memory-Enhanced Predictor for Multi-modal Sarcasm Detection},
author = {Junjie Chen and Hang Yu and Subin Huang and Sanmin Liu and Linfeng Zhang},
journal= {arXiv preprint arXiv:2406.16464},
year = {2025}
}
备注
ACM TOMM; Code and data are available at https://github.com/CoderChen01/InterCLIP-MEP