URMF:面向多模态讽刺检测的不确定性感知鲁棒多模态融合
计算机视觉与模式识别
2026-05-05 v2 人工智能
多媒体
摘要
多模态讽刺检测(MSD)旨在从文本与图像之间的语义不一致中识别讽刺意图。尽管近期方法通过跨模态交互和不一致推理改进了MSD,但大多数方法仍将各模态视为同等可靠。然而,在真实社交媒体帖子中,文本和图像在噪声水平和相关性上往往存在差异,这使得确定性融合容易受到噪声证据的影响,并削弱不一致线索。为解决这一问题,我们提出了不确定性感知鲁棒多模态融合(URMF),一个用于鲁棒MSD的统一框架。URMF首先通过多头交叉注意力将视觉证据注入文本表示,然后在融合语义空间中应用自注意力以增强不一致推理。它将文本、视觉和交互感知表示建模为可学习的高斯后验,以估计模态特定的不确定性。基于估计的不确定性,URMF在融合过程中动态调整模态贡献,以抑制不可靠证据。我们进一步通过一个统一目标优化模型,该目标结合了信息瓶颈正则化、模态先验正则化、跨模态分布对齐和不确定性驱动的对比学习。在公开的MSD和MMSD2基准上的实验表明,URMF优于代表性的单模态、多模态和基于MLLM的基线。结果表明,显式不确定性建模能够提高多模态讽刺检测的准确性和鲁棒性。
引用
@article{arxiv.2604.06728,
title = {URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection},
author = {Zhenyu Wang and Weichen Cheng and Weijia Li and Junjie Mou and Zongyou Zhao and Guoying Zhang},
journal= {arXiv preprint arXiv:2604.06728},
year = {2026}
}
备注
Accepted by ICIC 2026