基于视觉到情感描述翻译网络的面向目标的多模态情感分析
计算机视觉与模式识别
2024-08-21 v1 人工智能
摘要
自然语言处理和多媒体领域对多模态情感识别兴趣显著上升。因此,本研究旨在运用于识别与多模态帖子中每个目标(方面)相关联的情感水平的目标依赖性多模态情感分析(TDMSA)。尽管近期在多模态情感识别方面取得了进展,但缺乏明确地融合来自视觉模态中情感线索,特别是针对面部表情的情感线索。面临的挑战在于熟练获取视觉和情感线索,并随后将其同步到文本内容中。鉴于此,本研究提出了一种 novel 方法,称为视觉到情感描述翻译网络(Visual-to-Emotional-Caption Translation Network, VECTN)技术。该策略的主要目标是通过分析面部表情有效获取视觉情感线索。此外,它有效地将所获取的情感线索与标题模式的目标属性相结合。实验结果表明,该方法在应用于两个公开可用的多模态Twitter数据集(Twitter-2015和Twitter-2017)时能够取得突破性成果。实验结果显示,所提出的模型在Twitter-15数据集上实现了81.23%的准确率和80.61%的宏平均F1分数,而在Twitter-17数据集上分别为77.42%和75.19%。所观察到的性能提升表明,该模型在利用面部表情收集多模态数据中的目标级情感方面优于其他方法。
引用
@article{arxiv.2408.10248,
title = {Target-Dependent Multimodal Sentiment Analysis Via Employing Visual-to Emotional-Caption Translation Network using Visual-Caption Pairs},
author = {Ananya Pandey and Dinesh Kumar Vishwakarma},
journal= {arXiv preprint arXiv:2408.10248},
year = {2024}
}