用于抑郁与焦虑的语音生物标志物
机器学习
2026-05-12 v1 人工智能
声音
摘要
当前从语音中检测抑郁和焦虑的方法主要依赖于机器学习技术,这些技术利用人工设计的副语言特征以及源自语音信号时频域表示的相关声学描述符。将深度学习方法直接应用于原始语音信号,有可能产生预测能力大幅提升的生物标志物表示。然而,这些方法通常需要大量精心标注的数据,以学习底层生物标志物的鲁棒且具有临床意义的表示。在本文中,我们描述了我们在开发深度学习模型方面的努力,该模型在一个大规模专有数据集上进行训练,该数据集包含从超过 23,000 名代表美国相关人口统计特征的受试者中收集的约 65,000 条话语。我们展示了所采用的技术并分析了其对模型性能的影响。我们的结果表明,所提出的模型能够提取与内容无关的生物标志物信息,当这些信息与从音频中提取的词汇特征相结合时,可在生产环境中产生更好的预测性能。我们的模型在约 5,000 名独立受试者上进行了评估,在敏感性和特异性方面达到了 71% 的性能。为了促进基于语音的心理健康评估研究,我们在 HuggingFace 上发布了本文中描述的性能最佳的模型。
引用
@article{arxiv.2605.09908,
title = {Voice Biomarkers for Depression and Anxiety},
author = {Oleksii Abramenko and Noah D. Stein and Colin Vaz},
journal= {arXiv preprint arXiv:2605.09908},
year = {2026}
}