基于 Transformer 与张量积的多模态融合网络用于学生情绪识别
计算机视觉与模式识别
2024-11-19 v4
摘要
本文介绍了一种基于 Transformer 架构和张量积融合策略的新型多模态模型,该模型结合 BERT 的文本向量和 ViT 的图像向量对学生心理状况进行分类,准确率达到 93.65%。研究旨在从多种数据源准确分析学生的心理健康状态。本文讨论了模态融合方法,包括早期融合、晚期融合和中间融合,以克服整合多模态信息的挑战。消融研究比较了不同模型和融合技术的性能,表明所提出的模型在准确率和推理速度方面优于 CLIP 和 ViLBERT 等现有方法。结论指出,虽然该模型在情绪识别方面具有显著优势,但其整合其他数据模态的潜力为未来研究提供了方向。
引用
@article{arxiv.2403.08511,
title = {A Multimodal Fusion Network For Student Emotion Recognition Based on Transformer and Tensor Product},
author = {Ao Xiang and Zongqing Qi and Han Wang and Qin Yang and Danqing Ma},
journal= {arXiv preprint arXiv:2403.08511},
year = {2024}
}