基于分层音频样本数据的抑郁症自动检测
声音
2021-11-23 v1 人机交互
音频与语音处理
摘要
抑郁症是一种常见精神障碍,已影响全球数百万人,并随着 COVID-19 的到来而愈发严重。然而,由于精神科医生严重短缺,许多地区无法获得恰当诊断。在低收入国家这一匮乏更为恶化,其精神科医生与人口之比仅为经济较好国家的 1/210。本研究旨在探索深度学习从语音样本诊断抑郁症的应用。我们从 DAIC-WOZ 数据库收集数据,包含来自 154 名个体的 189 段语音记录。PHQ-8 评分大于等于 10 的患者语音样本被视为抑郁,评分低于 10 的视为健康。我们应用梅尔谱图从音频中提取相关特征。测试了三类编码器:一维 CNN、一维 CNN-LSTM 与一维 CNN-GRU。在系统调优超参数后,我们发现核大小为 5、使用 15 秒录音数据的一维 CNN-GRU 编码器表现最佳,F1 分数为 0.75、精确率为 0.64、召回率为 0.92。
引用
@article{arxiv.2111.10783,
title = {Automatic Detection of Depression from Stratified Samples of Audio Data},
author = {Pongpak Manoret and Punnatorn Chotipurk and Sompoom Sunpaweravong and Chanati Jantrachotechatchawan and Kobchai Duangrattanalert},
journal= {arXiv preprint arXiv:2111.10783},
year = {2021}
}
备注
30 pages, 6 figures