中文

基于 Transformer 与张量积的多模态融合网络用于学生情绪识别

计算机视觉与模式识别 2024-11-19 v4

摘要

本文介绍了一种基于 Transformer 架构和张量积融合策略的新型多模态模型,该模型结合 BERT 的文本向量和 ViT 的图像向量对学生心理状况进行分类,准确率达到 93.65%。研究旨在从多种数据源准确分析学生的心理健康状态。本文讨论了模态融合方法,包括早期融合、晚期融合和中间融合,以克服整合多模态信息的挑战。消融研究比较了不同模型和融合技术的性能,表明所提出的模型在准确率和推理速度方面优于 CLIP 和 ViLBERT 等现有方法。结论指出,虽然该模型在情绪识别方面具有显著优势,但其整合其他数据模态的潜力为未来研究提供了方向。

关键词

引用

@article{arxiv.2403.08511,
  title  = {A Multimodal Fusion Network For Student Emotion Recognition Based on Transformer and Tensor Product},
  author = {Ao Xiang and Zongqing Qi and Han Wang and Qin Yang and Danqing Ma},
  journal= {arXiv preprint arXiv:2403.08511},
  year   = {2024}
}