中文

通过语义完成与分解解决多模态情感检测中的情感不一致问题

计算机视觉与模式识别 2025-11-24 v2 计算与语言 多媒体 社会与信息网络

摘要

近年来,随着社交媒体帖子的增多,检测多模态 (图像-文本) 内容情感的需求迅速增长。由于帖子由用户生成,同一帖子中的图像和文本可能表达不同的甚至矛盾的情感,导致潜在的情感不一致问题。然而,现有工作主要采用单分支融合结构,主要捕捉图像和文本之间的一致情感。对不一致情感的忽视或隐式建模会导致单模态编码受损 and performance 受限。本文提出了一种语义完成与分解 (CoDe) 网络以解决上述问题。在语义完成模块中,我们通过补充图像和文本表示中的图像内文本语义来弥合情感差距。在语义分解模块中,我们通过独立投影和对比学习对图像和文本表示进行分解,从而显式捕捉跨模态的不一致情感。最后,我们通过跨注意力融合图像和文本表示,并将所学的不一致情感与之结合用于最终分类。在四个数据集上的大量实验表明,CoDe 的优势以及每个提议模块的有效性。

关键词

引用

@article{arxiv.2407.07026,
  title  = {Resolving Sentiment Discrepancy for Multimodal Sentiment Detection via Semantics Completion and Decomposition},
  author = {Daiqing Wu and Dongbao Yang and Huawen Shen and Can Ma and Yu Zhou},
  journal= {arXiv preprint arXiv:2407.07026},
  year   = {2025}
}

备注

Accepted by Pattern Recognition