通过纳入鼻音增强声学-发音语音逆映射
音频与语音处理
2025-09-01 v1
摘要
语音是通过声道收缩器官的协调产生的:嘴唇、舌头、软腭和声门。先前的工作开发了语音逆映射(SI)系统,用于恢复嘴唇和舌头收缩的声学到发音映射,称为口腔声道变量(TVs),后来通过纳入源信息(周期性和非周期性能量以及 F0 频率)作为声门控制的代理得到了增强。将鼻音测量与高速鼻咽镜检查进行比较表明,鼻音度可以作为真实值,用其训练的 SI 系统能够可靠地恢复美式英语说话者的软腭运动模式。这里比较了两种 SI 训练方法:独立估计口腔 TV 和鼻音度的基线模型,以及将口腔 TV 和源特征与鼻音度相结合的协同模型。协同模型在口腔 TV 估计方面相对于基线模型有 5% 的相对提升,在鼻音度估计方面有 9% 的相对提升。
引用
@article{arxiv.2506.09231,
title = {Enhancing Acoustic-to-Articulatory Speech Inversion by Incorporating Nasality},
author = {Saba Tabatabaee and Suzanne Boyce and Liran Oren and Mark Tiede and Carol Espy-Wilson},
journal= {arXiv preprint arXiv:2506.09231},
year = {2025}
}
备注
Accepted to be presented at Interspeech 2025