通过标记MRI 4D运动场的跨模态转换进行语音运动异常检测
声音
2024-02-13 v1 计算机视觉与模式识别
多媒体
音频与语音处理
图像与视频处理
摘要
理解语音过程中舌头运动模式与其产生的语音声学结果之间的关系,即构音-声学关系,对于评估语音质量和开发创新治疗与康复策略具有重要意义。在评估和检测语音相关障碍患者的异常构音特征时,这一点尤为重要。在本工作中,我们旨在开发一个框架,用于检测语音运动异常及其对应的语音声学。这是通过使用仅在健康个体数据上训练的深度跨模态转换器来实现的,该转换器弥合了从标记MRI获得的4D运动场与从语音声学数据导出的2D频谱图之间的差距。通过测量健康个体或患者的频谱图重建质量,训练好的转换器被用作异常检测器。具体而言,与健康个体相比,跨模态转换器在包含未见过的分布外模式的患者数据上可能表现出有限的泛化能力,并表现出较差的性能。随后使用单类SVM将健康个体的频谱图与患者的频谱图区分开来。为了验证我们的框架,我们总共收集了39对配对的标记MRI和语音波形,包含来自36名健康个体和3名舌癌患者的数据。我们使用了基于3D卷积和Transformer的深度转换模型,在健康训练集上训练它们,然后将它们应用于健康测试集和患者测试集。我们的框架展示了检测异常患者数据的能力,从而说明了其在增强对健康个体和患者构音-声学关系的理解方面的潜力。
引用
@article{arxiv.2402.06984,
title = {Speech motion anomaly detection via cross-modal translation of 4D motion fields from tagged MRI},
author = {Xiaofeng Liu and Fangxu Xing and Jiachen Zhuo and Maureen Stone and Jerry L. Prince and Georges El Fakhri and Jonghye Woo},
journal= {arXiv preprint arXiv:2402.06984},
year = {2024}
}
备注
SPIE Medical Imaging 2024: Image Processing