中文

迈向知识驱动的基于语音的抑郁症模型:利用语音元音的谱时变特征

机器学习 2022-10-07 v1 声音 音频与语音处理

摘要

与抑郁症相关的精神运动性迟滞已被证实与元音产生的显著差异有关。本文研究一种知识驱动的机器学习(ML)方法,该方法在元音层面融合语音的谱时信息以识别抑郁症。低层语音描述符由为元音分类训练的卷积神经网络(CNN)学习得到。这些低层描述符的时间演化通过长短期记忆(LSTM)模型在话语内与跨话语的高层进行建模,并由其给出最终抑郁判定。进一步使用改进版的局部可解释模型无关解释(LIME)来识别低层谱时元音变化对决策的影响,并观察抑郁可能性的高层时间变化。所提方法优于在不融合基于元音信息的情况下对语音谱时信息建模的基线,以及使用常规韵律与谱时特征训练的ML模型。所开展的可解释性分析表明,对应于非元音段的谱时信息不如基于元音的信息重要。进一步检视了捕捉逐段决策的高层信息对有无抑郁症受试者的可解释性。本工作的发现可为知识驱动的可解释决策支持系统奠定基础,协助临床医生更好地理解语音数据中的细粒度时间变化,最终增强心理健康诊断与照护。

关键词

引用

@article{arxiv.2210.02527,
  title  = {Toward Knowledge-Driven Speech-Based Models of Depression: Leveraging Spectrotemporal Variations in Speech Vowels},
  author = {Kexin Feng and Theodora Chaspari},
  journal= {arXiv preprint arXiv:2210.02527},
  year   = {2022}
}

备注

oral presentation for BHI 2022