基于 MRI 训练模型的干净语音声学到副鼻腔反演
音频与语音处理
2026-03-13 v1
摘要
副鼻腔声学反演从语音重建声道形状。实时磁共振成像 (rt-MRI) 允许同时获取语音信号和副鼻腔信息。除了 rt-MRI 获取的复杂性外,记录的音频被扫描仪噪声严重污染,需要去噪才能使用。对于实际应用,必须能够对在无噪声环境下记录的语音进行反演。本研究探讨了将干净声学环境中记录的语音作为替代去噪 MRI 语音的可能性。为此,我们比较了来自同一说话人的两个信号,这些信号在使用语音分段对齐的相同句子。评估了在去噪 MRI 语音上训练的模型在去噪 MRI 和干净语音上的表现。我们还评估了仅在干净语音上训练和测试的模型。结果表明,干净语音有效支持副鼻腔反演,实现的 RMSE 为 1.56 mm,接近 MRI 基准性能。
引用
@article{arxiv.2603.11845,
title = {Acoustic-to-Articulatory Inversion of Clean Speech Using an MRI-Trained Model},
author = {Sofiane Azzouz and Pierre-André Vuissoz and Yves Laprie},
journal= {arXiv preprint arXiv:2603.11845},
year = {2026}
}