中文

面向多模态讽刺检测的不确定性感知鲁棒融合:URMf 框架

机器学习 2026-04-09 v1

摘要

多模态讽刺检测(MSD)旨在从文本与图像之间的语义不一致中识别讽刺意图。尽管近期方法通过跨模态交互和不一致推理已改善了 MSD,但大多数方法仍将各模态视为等价可靠性。在真实社交媒体帖子中,文本和图像往往在噪声水平和相关性方面存在差异,这使得确定性融合易受噪声证据的影响并削弱不一致线索。为此,我们提出不确定性感知鲁棒融合(URMF),一个统一的鲁棒 MSD 框架。URMF 首先通过多头跨注意力将视觉证据注入文本表征,然后在融合语义空间中应用自注意力以增强不一致推理。它将文本、视觉以及交互感知的表征建模为可学习的高斯后验,以估计模态特定的不确定性。基于估计的不确定性,URMF 在融合过程中动态调整模态贡献以抑制不可靠证据。我们进一步通过结合信息瓶颈正则化、模态先验正则化、跨模态分布对齐以及不确定性驱动的对比学习来优化模型。在公开的 MSD 和 MMSD2 基准测试上实验表明,URMF 在代表性单模态、多模态和 MLLM 基线上均显著优于其他方法。结果表明,显式的不确定性建模可提升多模态讽刺检测的准确率和鲁棒性。

关键词

引用

@article{arxiv.2604.06727,
  title  = {Bi-level Heterogeneous Learning for Time Series Foundation Models: A Federated Learning Approach},
  author = {Shengchao Chen and Guodong Long and Dikai Liu and Jing Jiang},
  journal= {arXiv preprint arXiv:2604.06727},
  year   = {2026}
}

备注

31 pages