中文

基于多阶段扩张CNN-LSTM模型的语音抑郁严重程度分级分类

音频与语音处理 2021-04-12 v1 机器学习

摘要

基于语音的抑郁分类在近年来获得了极大的关注。然而,大多数分类研究集中于二分类,以区分抑郁受试者与非抑郁受试者。在本文中,我们将抑郁分类任务构建为一个严重程度分级分类问题,以赋予分类结果更细的粒度。我们使用为捕捉神经运动协调变化而开发的发音协调特征(ACFs),该变化由精神运动迟滞引起,而精神运动迟滞是重度抑郁症的必要特征。由声道变量(TVs)导出的ACFs被用于训练基于扩张卷积神经网络(CNN)的抑郁分类模型,以获得片段级预测。然后,我们提出一种基于循环神经网络(RNN)的方法,从片段级预测获得会话级预测。我们表明,当将会话级分类器训练于由其获得的嵌入上时,片段级分类器的优势被放大。与由梅尔频率倒谱系数(MFCCs)导出的ACFs相比,训练于由TVs导出的ACFs上的模型在会话级分类任务中取得了27.47%的未加权平均召回率(UAR)相对提升。

关键词

引用

@article{arxiv.2104.04195,
  title  = {Speech based Depression Severity Level Classification Using a Multi-Stage Dilated CNN-LSTM Model},
  author = {Nadee Seneviratne and Carol Espy-Wilson},
  journal= {arXiv preprint arXiv:2104.04195},
  year   = {2021}
}

备注

5 pages, submitted to Interspeech 2021. arXiv admin note: text overlap with arXiv:2011.06739