中文

VISTANet:用于可解释多模态情感识别的视觉-语音-文本加性网络

计算机视觉与模式识别 2025-05-27 v4

摘要

本文提出一种多模态情感识别系统,VIsual Spoken Textual Additive Net (VISTANet),将含图像、语音和文本的输入所反映的情感分类为离散类别。我们开发了一种新的可解释性技术,K-Average Additive exPlanation (KAAP),可识别导致预测特定情感类别的重要视觉、语音与文本特征。VISTANet 采用中间融合与后期融合的混合方式融合来自图像、语音和文本模态的信息,并在计算加权平均时自动调整其中间输出的权重。KAAP 技术计算各模态及相应特征对预测特定情感类别的贡献。为缓解以离散情感类别标注的多模态情感数据集的不足,我们构建了 IIT-R MMEmoRec 数据集,包含图像、对应语音与文本,以及情感标签('angry'、'happy'、'hate'、'sad')。VISTANet 在 IIT-R MMEmoRec 数据集上利用视觉、语音和文本模态取得了 80.11% 的总体情感识别准确率,优于单模态或双模态配置。代码与数据见 https://github.com/MIntelligence-Group/MMEmoRec。

关键词

引用

@article{arxiv.2208.11450,
  title  = {VISTANet: VIsual Spoken Textual Additive Net for Interpretable Multimodal Emotion Recognition},
  author = {Puneet Kumar and Sarthak Malik and Balasubramanian Raman and Xiaobai Li},
  journal= {arXiv preprint arXiv:2208.11450},
  year   = {2025}
}