AudVowelConsNet:一种基于音素级的深度CNN架构用于临床抑郁症诊断
声音
2020-11-05 v2 人机交互
音频与语音处理
摘要
抑郁症是一种常见且严重的情绪障碍,对患者日常任务中正常运作的能力产生负面影响。言语已被证明是抑郁症诊断的有力工具。精神病学研究集中于对促成言语中抑郁症表现的词级语音成分进行细粒度分析,并揭示抑郁言语在音素级存在显著变异。另一方面,基于机器学习的言语抑郁症自动识别研究聚焦于探索各类声学特征以检测抑郁症及其严重程度。少有研究关注将音素级语音成分纳入自动评估系统。本文提出一种基于人工智能(AI)的从言语进行临床抑郁症识别与评估的应用。我们通过深度学习探究音素单元(具体而言为元音与辅音)的声学特性以用于抑郁症识别。我们提出并比较三种基于谱图的深度神经网络架构,分别训练于音素辅音单元、元音单元及其融合。实验表明,深度学习得到的辅音基声学特性比元音基特性具有更优的识别结果。通过深度网络融合元音与辅音语音特性,显著优于单空间网络以及DAIC-WOZ数据库上的最先进深度学习方法。
引用
@article{arxiv.2010.16201,
title = {AudVowelConsNet: A Phoneme-Level Based Deep CNN Architecture for Clinical Depression Diagnosis},
author = {Muhammad Muzammel and Hanan Salam and Yann Hoffmann and Mohamed Chetouani and Alice Othmani},
journal= {arXiv preprint arXiv:2010.16201},
year = {2020}
}
备注
12 pages, 8 figures