中文

基于特征融合的语音精神分裂症严重程度估计

音频与语音处理 2024-11-21 v4

摘要

基于语音的精神分裂症谱系评估在近期已得到广泛研究。本研究中,我们开发了一个深度学习框架,通过特征融合方法从语音中估计精神分裂症严重程度分数,该方法将发音特征与来自预训练音频模型提取的不同自监督语音特征进行融合。我们还提出了一种基于自编码器的自监督表征学习框架,用于从语音中提取紧凑的发音嵌入表示。我们的最佳语音融合模型采用多头注意力机制(Multi-Head Attention, MHA),与之前结合语音和视频输入的模型相比,在精神分裂症严重程度估计中将平均绝对误差(MAE)降低了9.18%,均方根误差(RMSE)降低了9.36%。

关键词

引用

@article{arxiv.2411.06033,
  title  = {Speech-Based Estimation of Schizophrenia Severity Using Feature Fusion},
  author = {Gowtham Premananth and Carol Espy-Wilson},
  journal= {arXiv preprint arXiv:2411.06033},
  year   = {2024}
}

备注

Submitted to ICASSP-SPADE workshop 2025