Wavebender GAN:一种具语音学意义的语音操控架构
音频与语音处理
2022-05-03 v1 人机交互
机器学习
声音
摘要
深度学习已彻底改变了合成语音的质量。然而,迄今为止它对语音科学界贡献甚微。这些新方法未满足该领域从业者所需的可控性要求,例如在 manipulated 语音刺激的听辨测试中。相反,此类刺激中不同语音属性的控制是通过使用传统信号处理方法实现的。这限制了操控的范围、准确性和语音质量。此外,可听伪影对语音感知研究的方法学效度有负面影响。本工作引入了一个能够通过学习而非设计来操控语音属性的系统。该架构学习控制任意语音属性,并利用神经声码器的进展获得逼真输出。通过拷贝合成及一组核心语音特征(音高、共振峰和嗓音质量度量)操控的实验,说明了该方法在生成具有准确控制和高感知质量的语音刺激方面的前景。
引用
@article{arxiv.2202.10973,
title = {Wavebender GAN: An architecture for phonetically meaningful speech manipulation},
author = {Gustavo Teodoro Döhler Beck and Ulme Wennberg and Zofia Malisz and Gustav Eje Henter},
journal= {arXiv preprint arXiv:2202.10973},
year = {2022}
}
备注
5 pages, 4 figures; to appear at ICASSP 2022