中文

基于视频和音频输入的多模态情感分析

声音 2024-12-13 v1 人工智能 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

尽管当前针对视频和音频情感分析的研究已颇为丰富,但寻找能获得最高准确率的最佳模型仍被视为该领域的研究者面临的挑战。本文的主要目标是证明采用视频和音频输入进行情感识别模型的可用性。本论文使用的训练数据集分别为音频的 CREMA-D 数据集和视频的 RAVDESS 数据集。所使用的微调模型为:Facebook/wav2vec2-large 用于音频,Google/vivit-b-16x2-kinetics400 用于视频。将两种模型为每个情绪生成的概率平均后,用于决策框架中。若两种模型结果存在差异(即一方准确率显著高于另一方),则创建另一个测试框架。所采用的方法包括加权平均法、置信水平阈值法、基于置信度的动态加权法以及基于规则的逻辑法。这种有限的方法给出了令人鼓舞的结果,使得这些方法的后续研究变得可行。

关键词

引用

@article{arxiv.2412.09317,
  title  = {Multimodal Sentiment Analysis based on Video and Audio Inputs},
  author = {Antonio Fernandez and Suzan Awinat},
  journal= {arXiv preprint arXiv:2412.09317},
  year   = {2024}
}

备注

Presented as a full paper in the 15th International Conference on Emerging Ubiquitous Systems and Pervasive Networks (EUSPN 2024) October 28-30, 2024, Leuven, Belgium