通过多级模态增强与双阶段模态融合提升表情包情感理解能力
计算与语言
2025-11-17 v1 计算机视觉与模式识别
摘要
随着社交媒体和互联网文化的快速崛起,表情包已成为表达情感倾向的流行媒介。这催生了对表情包情感理解(Meme Emotion Understanding, MEU)的日益关注,该领域旨在利用表情包的多模态内容来分类其背后的情感意图。尽管现有方法取得了令人鼓舞的成果,但仍面临两个主要挑战:(1)缺乏细粒度的模态融合策略,(2) insufficiently 挖掘表情包隐含意义和背景知识。为此,我们提出了 MemoDetector,一种新型的 MEU 框架。首先,我们引入四步文本增强模块,利用多模态大语言模型(MLLM)的丰富知识与推理能力,逐步推断并提取表情包中的隐含信息与上下文洞见。这些增强后的文本显著丰富了原始表情包内容,为下游分类提供了有价值的指导。接着,我们设计了双阶段模态融合策略:第一阶段对原始表情包图像和文本进行浅层融合,而第二阶段深入整合增强后的视觉与文本特征。这种层次化融合使模型能够更好地捕捉细微的跨模态情感线索。在 MET-MEME 和 MOOD 两个数据集上的实验表明,我们的方法在两个数据集上均优于最先进的基线方法。具体而言,MemoDetector 在 MET-MEME 上的 F1 分数提升了 4.3%,在 MOOD 上的提升为 3.4%。进一步的消融研究和深入分析均验证了我们方法的有效性与鲁棒性,凸显了其在推动 MEU 领域发展中的重要潜力。我们的代码已公开于 https://github.com/singing-cat/MemoDetector。
引用
@article{arxiv.2511.11126,
title = {Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion},
author = {Yi Shi and Wenlong Meng and Zhenyuan Guo and Chengkun Wei and Wenzhi Chen},
journal= {arXiv preprint arXiv:2511.11126},
year = {2025}
}