基于上下文注意力的LLM与CNN多模态融合用于情感分析
机器学习
2025-08-20 v1 人工智能
信息检索
摘要
本文介绍了一种用于社交媒体多模态情感分析的新方法,特别是在自然灾害背景下,理解公众情感对于有效危机管理至关重要。与传统方法分别处理文本和图像模态不同,我们的方法将基于卷积神经网络(CNN)的图像分析与基于大语言模型(LLM)的文本处理无缝集成,利用生成式预训练Transformer(GPT)和提示工程从CrisisMMD数据集中提取情感相关特征。为了有效建模模态间关系,我们在融合过程中引入了上下文注意力机制。利用上下文注意力层,该机制有效捕捉了模态间的交互,增强了模型对文本与视觉数据之间复杂关系的理解。我们模型的深度神经网络架构从这些融合特征中学习,与现有基线相比,提高了准确性。实验结果表明,在将社交媒体数据分类为各种自然灾害中的信息性和非信息性类别方面取得了显著进步。我们的模型在准确率上实现了2.43%的提升,在F1分数上实现了5.18%的提升,突显了其在处理复杂多模态数据方面的有效性。除了定量指标外,我们的方法还提供了对危机期间表达的情感的更深入洞察。其实际意义延伸至实时灾害管理,增强的情感分析可以优化紧急干预的准确性。通过弥合多模态分析、LLM驱动的文本理解与灾害响应之间的差距,我们的工作为人工智能(AI)驱动的危机管理解决方案指明了一个有前景的方向。
引用
@article{arxiv.2508.13196,
title = {Contextual Attention-Based Multimodal Fusion of LLM and CNN for Sentiment Analysis},
author = {Meriem Zerkouk and Miloud Mihoubi and Belkacem Chikhaoui},
journal= {arXiv preprint arXiv:2508.13196},
year = {2025}
}
备注
The 38th Canadian Conference on Artificial Intelligence ( 2025 )