基于实时 MRI 声道形状动力学迈向自动语音辨识
声音
2018-07-31 v1 计算与语言
计算机视觉与模式识别
机器学习
音频与语音处理
摘要
声道构型通过在言语产生中调节气流并创建不同的共振腔,在生成可区分的语音声音方面起着至关重要的作用。它们包含丰富的信息,可用于更好地理解潜在的言语产生机制。作为将声道形状几何自动映射到声学的一步,本文采用有效的视频动作识别技术,如长短期递归卷积网络(LRCN)模型,从声道的动态形状中识别不同的元音-辅音-元音(VCV)序列。此类模型通常将基于 CNN 的深度分层视觉特征提取器与递归网络相结合,理想情况下使网络在空间和时间上足够深,以学习短视频片段的序列动态用于视频分类任务。我们使用一个包含 17 名说话者在 VCV 发声期间声道形状的二维实时 MRI 的数据库。讨论了该类算法在各种参数设置下以及针对各种分类任务的比较性能。有趣的是,结果显示在语音分类背景下,模型性能相对于通用序列或视频分类任务存在显著差异。
引用
@article{arxiv.1807.11089,
title = {Towards Automatic Speech Identification from Vocal Tract Shape Dynamics in Real-time MRI},
author = {Pramit Saha and Praneeth Srungarapu and Sidney Fels},
journal= {arXiv preprint arXiv:1807.11089},
year = {2018}
}
备注
To appear in the INTERSPEECH 2018 Proceedings