中文

基于实时 MRI 发音时间动态的可解释音素识别建模

图像与视频处理 2026-01-30 v2 声音 音频与语音处理

摘要

实时磁共振成像(rtMRI)能够可视化声道动作,为语音发音提供了一个全面的窗口。然而,其信号维度高且含噪,阻碍了解释。我们研究了从正中矢状面声道 rtMRI 视频中提取时空发音动态的紧凑表示,用于音素识别。我们比较了三种特征类型:(1)原始视频,(2)光流,以及(3)用于发音器运动的六个具有语言学相关性的感兴趣区域(ROI)。我们评估了在每种表示上独立训练的模型,以及多特征组合。结果表明,多特征模型始终优于单特征基线,其中结合 ROI 和原始视频获得了最低的 0.34 音素错误率(PER)。时间保真度实验表明对细粒度发音动态的依赖,而 ROI 消融研究揭示了舌头和嘴唇的强贡献。我们的发现突出了 rtMRI 衍生特征如何提供准确性和可解释性,并确立了在语音处理中利用发音数据的策略。

关键词

引用

@article{arxiv.2509.15689,
  title  = {Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition},
  author = {Jay Park and Hong Nguyen and Sean Foley and Jihwan Lee and Yoonjeong Lee and Dani Byrd and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2509.15689},
  year   = {2026}
}