中文

基于概念激活向量的多模态情绪识别可解释性研究

机器学习 2024-10-28 v1

摘要

多模态情绪识别是指将输入视频序列基于多种输入模态(通常为视频、音频和文本)分类为情绪标签。近年来,深度神经网络在识别人类情绪方面表现出卓越的性能,并且在该任务上已达到与人类水平相当的表现。尽管该领域近期取得了进展,但由于推理与决策过程的不透明性,情绪识别系统尚未被真实场景所接受。该领域大多数研究致力于新颖的架构以提升此任务的性能,仅有少数尝试为这些模型的决策提供解释。在本文中,我们针对情绪识别背景下神经网络的可解释性问题,使用概念激活向量(CAVs)加以解决。为分析模型的隐空间,我们定义了特定于 Emotion AI 的人类可理解概念,并将其映射到广泛使用的 IEMOCAP 多模态数据库。随后,我们在双向上下文 LSTM(BC-LSTM)网络的多个层上评估我们所提出概念的影响,以表明情绪识别神经网络的推理过程可以用人类可理解的概念来表示。最后,我们对所提出的概念进行假设检验,以表明它们对该任务的可解释性具有显著意义。

关键词

引用

@article{arxiv.2202.01072,
  title  = {Interpretability for Multimodal Emotion Recognition using Concept Activation Vectors},
  author = {Ashish Ramayee Asokan and Nidarshan Kumar and Anirudh Venkata Ragam and Shylaja S Sharath},
  journal= {arXiv preprint arXiv:2202.01072},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication