中文

基于语音和语数据的多模态贝叶斯网络用于症状水平的抑郁和焦虑预测

机器学习 2025-12-19 v1 声音

摘要

在精神评估期间,医生不仅观察患者报告的内容,还要观察语调、说话速度、流畅度、响应性以及身体语言等重要的非语言信号。对这些不同信息来源的加权与整合是一项具有挑战性的任务,亦是智能工具支持的理想候选对象——然而这在临床实践中尚未得到实现。本文主张可通过贝叶斯网络建模来解决这几个 adoption 障碍。为此,我们评估了一个来自大规模数据集(30,135 个独立说话者)中语音和语音特征的抑郁和焦虑症状预测模型。除了对疾病和症状的性能指标(抑郁的 ROC-AUC=0.842,ECE=0.018,0.015;核心个体症状的 ROC-AUC>0.74),我们还评估了人口统计学公平性,并探讨了不同输入模态类型之间的集成与冗余性。我们还考察了临床实用性指标以及对心理健康服务用户的可接受性。当提供充分丰富且大规模的多模态数据流并针对常见精神疾病的症状而非疾病水平进行建模时,这类模型是构建稳健评估支持工具的原则方法:以透明且可解释的格式提供临床相关输出,直接可纳入专家临床监督。

关键词

引用

@article{arxiv.2512.07741,
  title  = {A multimodal Bayesian Network for symptom-level depression and anxiety prediction from voice and speech data},
  author = {Agnes Norbury and George Fairs and Alexandra L. Georgescu and Matthew M. Nour and Emilia Molimpakis and Stefano Goria},
  journal= {arXiv preprint arXiv:2512.07741},
  year   = {2025}
}