中文

基于分层音频样本数据的抑郁症自动检测

声音 2021-11-23 v1 人机交互 音频与语音处理

摘要

抑郁症是一种常见精神障碍,已影响全球数百万人,并随着 COVID-19 的到来而愈发严重。然而,由于精神科医生严重短缺,许多地区无法获得恰当诊断。在低收入国家这一匮乏更为恶化,其精神科医生与人口之比仅为经济较好国家的 1/210。本研究旨在探索深度学习从语音样本诊断抑郁症的应用。我们从 DAIC-WOZ 数据库收集数据,包含来自 154 名个体的 189 段语音记录。PHQ-8 评分大于等于 10 的患者语音样本被视为抑郁,评分低于 10 的视为健康。我们应用梅尔谱图从音频中提取相关特征。测试了三类编码器:一维 CNN、一维 CNN-LSTM 与一维 CNN-GRU。在系统调优超参数后,我们发现核大小为 5、使用 15 秒录音数据的一维 CNN-GRU 编码器表现最佳,F1 分数为 0.75、精确率为 0.64、召回率为 0.92。

关键词

引用

@article{arxiv.2111.10783,
  title  = {Automatic Detection of Depression from Stratified Samples of Audio Data},
  author = {Pongpak Manoret and Punnatorn Chotipurk and Sompoom Sunpaweravong and Chanati Jantrachotechatchawan and Kobchai Duangrattanalert},
  journal= {arXiv preprint arXiv:2111.10783},
  year   = {2021}
}

备注

30 pages, 6 figures