基于时序的模型在多模态情绪识别中的比较
机器学习
2023-06-23 v1
摘要
情绪识别已成为人机交互领域的重要研究课题。基于声音和视频理解情绪的研究主要关注面部表情分析并分类6种基本情绪。本研究比较了不同序列模型在多模态情绪识别中的性能。声音和图像首先由多层CNN模型处理,这些模型的输出被输入到各种序列模型中。序列模型为GRU、Transformer、LSTM和Max Pooling。计算了所有模型的准确率、精确率和F1分数。实验使用了多模态CREMA-D数据集。在对CREMA-D数据集比较的结果中,基于GRU的架构以0.640在F1分数上表现最佳,基于LSTM的架构以0.699在精确率指标上最佳,而基于Max Pooling的架构以0.620在灵敏度上随时间表现最佳。结果表明,各序列模型性能相近。
引用
@article{arxiv.2306.13076,
title = {A Comparison of Time-based Models for Multimodal Emotion Recognition},
author = {Ege Kesim and Selahattin Serdar Helli and Sena Nur Cavsak},
journal= {arXiv preprint arXiv:2306.13076},
year = {2023}
}
备注
in Turkish language