中文

MGHFT:面向跨模态贴纸情感识别的多粒度层次化融合 Transformer

计算机视觉与模式识别 2025-07-28 v1 人工智能

摘要

虽然基于文本的预训练视觉模型在视觉特征提取方面显示出强大的能力,但贴纸情感理解仍具有挑战性,原因在于其依赖于多视角信息,如背景知识和风格线索。为此,我们提出一种新型的多粒度层次化融合变换器(MGHFT),其基于多模态大语言模型(Multimodal Large Language Models)的多视角贴纸解释器。具体而言,灵感来自人类从多个视角解读贴纸情感的能力,我们首先通过提供丰富的多视角描述性文本上下文,使用多模态大语言模型对贴纸进行解释。随后,我们设计了一种层次化融合策略,将文本上下文融入视觉理解,该策略基于金字塔视觉变换器,在多个阶段提取全局和局部贴纸特征。通过对比学习和注意力机制,在视觉主干网络的不同阶段注入文本特征,增强了全局和局部粒度视觉语义与文本指导的融合。最后,我们引入一种文本引导的融合注意力机制,以有效整合整体多模态特征,提升语义理解。广泛的在 2 个公开贴纸情感数据集上的实验表明,MGHFT 显著优于现有的贴纸情感识别方法,实现了更高的准确率和更细粒度的情感识别。与最佳预训练视觉模型相比,MGHFT 在 F1 分数上提升了 5.4%,在准确率上提升了 4.0%。代码已发布于 https://github.com/cccccj-03/MGHFT_ACMMM2025。

关键词

引用

@article{arxiv.2507.18929,
  title  = {MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition},
  author = {Jian Chen and Yuxuan Hu and Haifeng Lu and Wei Wang and Min Yang and Chengming Li and Xiping Hu},
  journal= {arXiv preprint arXiv:2507.18929},
  year   = {2025}
}

备注

Accepted by ACMMM2025