基于自监督多模态语音表示的精神分裂症症状评估
音频与语音处理
2024-11-19 v5 声音
信号处理
摘要
近年来,多模态精神分裂症评估系统受到广泛关注。本文提出一种精神分裂症评估系统,用于区分精神分裂症的主要症状类别并预测整体精神分裂症严重程度。我们开发了基于向量量化变分自编码器 (VQ-VAE) 的多模态表征学习 (MRL) 模型,从声学挤压变量 (TVs) 和面部动作单元 (FAUs) 中生成任务无关的语音表征。随后,这些表征被用于基于多任务学习 (MTL) 的下游预测模型,以获得类别标签和整体严重程度评分。该框架在所有评估指标上(加权 F1 分数、AUC-ROC 分数和加权准确率)均优于先前方法。此外,它还估计了精神分裂症的严重程度评分,这一任务未被早期方法所涉及。
引用
@article{arxiv.2409.09733,
title = {Self-supervised Multimodal Speech Representations for the Assessment of Schizophrenia Symptoms},
author = {Gowtham Premananth and Carol Espy-Wilson},
journal= {arXiv preprint arXiv:2409.09733},
year = {2024}
}