中文

有序情感空间中的可信多模态融合用于情感分析

计算机视觉与模式识别 2024-04-16 v1

摘要

多模态视频情感分析旨在整合多种模态信息来分析说话者的观点和态度。以往的工作大多侧重于探索模态内和模态间的语义交互。然而,这些工作忽略了多模态的可靠性问题,即模态往往包含噪声、语义歧义、模态缺失等情况。此外,现有方法通常平等对待不同模态,很大程度上忽略了它们的不同贡献。再者,现有的多模态情感分析方法直接回归情感分数,而未考虑情感类别之间的有序关系,限制了性能。为解决上述问题,我们提出了一种可信的多模态情感有序网络 (TMSON) 以提升情感分析性能。具体而言,我们首先为每种模态设计一个单模态特征提取器以获得模态特定特征。接着,我们定制了一个不确定性分布估计网络来估计单模态的不确定性分布。然后,我们对学习到的单模态分布进行贝叶斯融合,以获得用于情感预测的多模态分布。最后,我们构建了一个有序感知的情感空间,通过有序回归约束多模态分布。我们提出的 TMSON 在多模态情感分析任务上优于现有基线,实证结果表明 TMSON 能够有效降低不确定性,获得更稳健的预测。

引用

@article{arxiv.2404.08923,
  title  = {Trustworthy Multimodal Fusion for Sentiment Analysis in Ordinal Sentiment Space},
  author = {Zhuyang Xie and Yan Yang and Jie Wang and Xiaorong Liu and Xiaofan Li},
  journal= {arXiv preprint arXiv:2404.08923},
  year   = {2024}
}

备注

14 pages, 9 figures, Accepted by IEEE Transactions on Circuits and Systems for Video Technology