中文

一种利用数据增强、基于知识驱动的元音级语音抑郁症分类方法

声音 2022-10-28 v1 机器学习 音频与语音处理

摘要

我们提出了一种新颖的可解释机器学习模型,该模型通过建模话语间的时间依赖性并利用元音级别的频谱时间信息,从语音中识别抑郁症。我们的方法首先使用带有空间金字塔池化层的卷积神经网络(“元音CNN”),在局部层面将可变长度的话语建模为固定大小的基于元音的嵌入。随后,在全局层面,从一组作为另一个一维CNN(“抑郁症CNN”)输入的元音CNN嵌入中对抑郁症进行分类。为元音CNN和抑郁症CNN的训练设计了不同的数据增强方法。我们研究了所提系统在建模短、中、长分析窗口(分别对应10、21和42个话语)时,在不同时间粒度下的性能。所提方法达到了与先前最优方法相当的性能,并展现了关于抑郁症结果的可解释特性。这项工作的发现可能通过在人机联合决策任务中提供额外的直觉来帮助临床医生。

关键词

引用

@article{arxiv.2210.15261,
  title  = {A knowledge-driven vowel-based approach of depression classification from speech using data augmentation},
  author = {Kexin Feng and Theodora Chaspari},
  journal= {arXiv preprint arXiv:2210.15261},
  year   = {2022}
}