基于语音信号中声学反演的声道重建:通过语音学表征利用MRI数据
音频与语音处理
2026-03-13 v1
摘要
语音声学反演旨在从语音信号中重建声道的完整几何结构。本文提出了一种比较研究,评估不同语音学分段精度水平,并与我们先前工作中基于梅尔频率倒谱系数(MFCCs)的基线方法进行比较。所考虑的所有方法均基于去噪后的语音信号,旨在通过三个 successive 水平来探讨纳入语音学信息的影响:未纠正的自动转录、时间对齐的语音学分段,以及遵循对齐后的专家手动校正。这些模型被训练以预测从声道MRI图像中提取的 articulatory 轮廓,使用自动轮廓跟踪方法。结果表明,在依赖语音学表征的模型中,遵循对齐后的手动校正能获得最佳性能,接近于基线方法。
引用
@article{arxiv.2603.11847,
title = {Reconstruction of the Vocal Tract from Speech via Phonetic Representations Using MRI Data},
author = {Sofiane Azzouz and Pierre-André Vuissoz and Yves Laprie},
journal= {arXiv preprint arXiv:2603.11847},
year = {2026}
}