基于卷积神经网络的多模态精神分裂症神经运动协调性评估方法
音频与语音处理
2023-05-18 v1 多媒体
声音
摘要
本研究使用两种截然不同的通道延迟相关方法,调查了表现出强烈阳性症状(例如幻觉和妄想)的精神分裂症受试者的语音发音协调性。我们表明,具有强烈阳性症状且病情明显的精神分裂症受试者,在面部和语音姿态中呈现出比健康受试者所观察到的更为复杂的发音协调模式。这种语音协调模式的差异被用于训练一个多模态卷积神经网络(CNN),该网络利用语音期间的视频和音频数据来区分具有强烈阳性症状的精神分裂症患者与健康受试者。我们还表明,在与面部动作单元(FAUs)融合时,对应于发音部位和声门源的声道变量(TVs)优于梅尔频率倒谱系数(MFCCs)。对于我们收集的临床数据集,我们性能最佳的多模态网络相对于采用融合 FAUs 和 MFCCs 的完整声道协调(FVTC)基线方法,将检测精神分裂症的平均 F1 分数提高了约 18%。
引用
@article{arxiv.2110.04440,
title = {Multimodal Approach for Assessing Neuromotor Coordination in Schizophrenia Using Convolutional Neural Networks},
author = {Yashish M. Siriwardena and Chris Kitchen and Deanna L. Kelly and Carol Espy-Wilson},
journal= {arXiv preprint arXiv:2110.04440},
year = {2023}
}
备注
5 pages. arXiv admin note: text overlap with arXiv:2102.07054