从耳语语音的共振峰中恢复隐式音高轮廓
音频与语音处理
2023-07-07 v1
摘要
耳语语音的特征在于类噪声激励导致基频缺失。考虑到语调等韵律现象通过 f0 变化被感知,耳语韵律的感知相对困难。同时,研究表明说话者在耳语时确实试图产生语调,且韵律变异性得以传递,暗示语调在耳语共振峰结构中“幸存”。本文旨在利用机器学习模型估计共振峰轮廓与耳语中“隐式”音高轮廓的关联方式。我们提出一种两步法:首先使用平行语料库,通过去噪自编码器将耳语共振峰转换为其发声等效形式;随后分析共振峰轮廓以预测发声音高轮廓变化。我们观察到,该方法能有效建立耳语与发声共振峰之间的关系,并揭示耳语中的隐式音高轮廓。
引用
@article{arxiv.2307.03168,
title = {Recovering implicit pitch contours from formants in whispered speech},
author = {Pablo Pérez Zarazaga and Zofia Malisz},
journal= {arXiv preprint arXiv:2307.03168},
year = {2023}
}
备注
5 pages, 3 figures, 2 tables, Accepted at ICPhS 2023