中文

用于从语音检测抑郁症的成本效益模型

声音 2023-02-21 v1 音频与语音处理 机器学习

摘要

抑郁症是最常见的心理障碍,被认为是全球范围内导致残疾和自杀的主要原因。一种能够检测人类语音中抑郁迹象的自动化系统,有助于确保患有该障碍的个体获得及时有效的心理健康护理。开发此类自动化系统需要能够捕捉抑郁迹象的精确机器学习模型。然而,基于深度声学表征的最先进模型需要充足的数据、细致的特征选择以及严格的训练;该过程涉及巨大的计算资源。在这项工作中,我们探索了两组不同声学特征——传统手工策划特征和深度表征特征——在从语音预测抑郁严重程度方面的有效性。我们探讨了可能影响模型性能的相关因素,包括个体的性别、障碍的严重程度、语音的内容和时长。我们的发现表明,基于传统声学特征训练的模型,其性能与基于深度表征特征训练的模型相当或更优,且计算成本显著更低,无论其他因素(如语音内容和时长、说话者性别及障碍严重程度)如何。这使得此类模型更适合部署在计算资源受限的场景中,例如智能设备中的实时抑郁监测应用。

关键词

引用

@article{arxiv.2302.09214,
  title  = {Cost-effective Models for Detecting Depression from Speech},
  author = {Mashrura Tasnim and Jekaterina Novikova},
  journal= {arXiv preprint arXiv:2302.09214},
  year   = {2023}
}

备注

Accepted to ICMLA 2022