利用文本线索通过对象识别增强多模态情感分析
机器学习
2026-02-03 v1
摘要
多模态情感分析由于文本与图像模态的差异、情感的模糊性以及语境含义的复杂性,面临多个挑战。本文在两个数据集上实验探讨了图像和文本数据的情感识别,分别进行单独分析或组合分析。方法的一部分引入了 novel `Textual-Cues for Enhancing Multimodal Sentiment Analysis' (TEMSA) 以应对多模态情感分析中的困难。具体而言,我们提取图像中检测到的所有对象名称,并将其与关联文本组合;我们称这种文本与图像数据的组合为 TEMS。我们的结果表明,仅使用 TEMS 在考虑所有对象名称进行整体情感分析时,优于单独分析。这项研究推动了多模态情感分析的发展,提供了 TEMSA 在组合图像和文本数据进行多模态情感分析方面效果的见解。
引用
@article{arxiv.2602.00360,
title = {Leveraging Textual-Cues for Enhancing Multimodal Sentiment Analysis by Object Recognition},
author = {Sumana Biswas and Karen Young and Josephine Griffith},
journal= {arXiv preprint arXiv:2602.00360},
year = {2026}
}