GCM-Net:基于元启发式网络的图增强跨模态灌注用于视频情感与情绪分析
计算机视觉与模式识别
2024-10-18 v1 机器学习
摘要
情感分析和情绪识别在视频中面临的挑战在于不同模态信息的多样性与复杂性。开发能够有效应对各模态不同特征的高效框架是该领域的首要关注点。先前的多模态情感与情绪分析研究常忽视模态集成的有效融合、模态间语境一致性以及优化拼接特征空间,导致架构次优。本文提出了一种新框架,利用话语的多模态语境信息,并应用元启发式算法学习话语级情感与情绪预测的贡献特征。我们的图增强跨模态灌注元启发式驱动网络(GCM-Net)集成图采样与聚合,以重新校准视频情感与情绪预测的模态特征。GCM-Net包含决定模态间交互和话语相关性的跨模态注意力模块。一个调和优化模块采用元启发式算法组合注意特征,支持单语和多语输入。为展示方法有效性,我们在三个主要多模态基准数据集上进行了广泛评估:CMU MOSI、CMU MOSEI 和 IEMOCAP。实验结果表明,我们的方法在 MOSI 和 MOSEI 数据集上的情感分析准确率分别达到 91.56% 和 86.95%,在 IEMOCAP 数据集上的情绪分析准确率为 85.66%,显著优于现有方法。
引用
@article{arxiv.2410.12828,
title = {GCM-Net: Graph-enhanced Cross-Modal Infusion with a Metaheuristic-Driven Network for Video Sentiment and Emotion Analysis},
author = {Prasad Chaudhari and Aman Kumar and Chandravardhan Singh Raghaw and Mohammad Zia Ur Rehman and Nagendra Kumar},
journal= {arXiv preprint arXiv:2410.12828},
year = {2024}
}