中文

基于语音信号中声学反演的声道重建:通过语音学表征利用MRI数据

音频与语音处理 2026-03-13 v1

摘要

语音声学反演旨在从语音信号中重建声道的完整几何结构。本文提出了一种比较研究,评估不同语音学分段精度水平,并与我们先前工作中基于梅尔频率倒谱系数(MFCCs)的基线方法进行比较。所考虑的所有方法均基于去噪后的语音信号,旨在通过三个 successive 水平来探讨纳入语音学信息的影响:未纠正的自动转录、时间对齐的语音学分段,以及遵循对齐后的专家手动校正。这些模型被训练以预测从声道MRI图像中提取的 articulatory 轮廓,使用自动轮廓跟踪方法。结果表明,在依赖语音学表征的模型中,遵循对齐后的手动校正能获得最佳性能,接近于基线方法。

关键词

引用

@article{arxiv.2603.11847,
  title  = {Reconstruction of the Vocal Tract from Speech via Phonetic Representations Using MRI Data},
  author = {Sofiane Azzouz and Pierre-André Vuissoz and Yves Laprie},
  journal= {arXiv preprint arXiv:2603.11847},
  year   = {2026}
}