中文

用于从音频信号感知压力的Emo-CNN:一种脑化学方法

人机交互 2020-01-09 v1 人工智能 声音 音频与语音处理

摘要

情绪在医疗保健等许多应用中起着关键作用,可用于收集患者的情绪行为。某些情绪因其在理解人类感受方面的有效性而受到更多重视。在本文中,我们提出一种从音频信号建模人类压力的方法。语音情感检测的研究挑战在于定义压力的确切含义并能够精确地对其分类。包括最先进的深度学习分类方法在内的监督机器学习模型依赖于干净且带标签数据的可用性。情感计算与情绪检测中的一个问题是带标注的压力数据量有限。现有的标注压力情绪数据集高度依赖于标注者的主观感知。我们通过利用卷积神经网络中传统的MFCC特征来解决特征选择的第一问题。我们的实验表明,Emo-CNN在多个数据集上持续且显著优于现有的流行方法。它在Emo-DB数据集上达到了90.2%的类别准确率。为解决第二个也是更显著的标签主观性问题,我们使用Lovheim立方,它是情绪的三维投影。该立方旨在解释这些神经递质与情绪在3D空间中位置之间的关系。从Emo-CNN学到的情绪表示通过三分量PCA(主成分分析)映射到该立方,然后用于建模人类压力。这一提出的方法不仅规避了对标注压力数据的需求,还符合Lovheim立方给出的心理学情绪理论。我们认为这项工作是建立人工智能与人类情绪化学之间联系的第一步。

关键词

引用

@article{arxiv.2001.02329,
  title  = {Emo-CNN for Perceiving Stress from Audio Signals: A Brain Chemistry Approach},
  author = {Anup Anand Deshmukh and Catherine Soladie and Renaud Seguier},
  journal= {arXiv preprint arXiv:2001.02329},
  year   = {2020}
}

备注

2 pages, 2 tables and 2 figures