Intelli-Z:面向可懂度的零样本文本转语音
音频与语音处理
2024-01-31 v1 声音
摘要
尽管近期大量研究提出了利用大规模真实世界数据进行零样本文本转语音(TTS)的新框架,但关注零样本TTS可懂度的研究相对较少。零样本TTS因其在推理阶段需要用新参数(说话人嵌入或声学提示)替换核心参数的内在要求,需要额外努力来确保清晰的发音和语音质量。在本研究中,我们提出了一种专注于可懂度的零样本TTS模型,称为Intelli-Z。Intelli-Z通过使用多说话人TTS作为教师来学习说话人嵌入,并采用循环一致性损失进行训练,以包含不匹配的文本-语音对用于训练。此外,它沿时间维度选择性聚合说话人嵌入,以最小化推理阶段参考语音文本内容的干扰。我们通过消融研究证实了所提方法的有效性。当应用前两种方法时,未见说话人的平均意见得分(MOS)提高了9%,当应用选择性时间聚合时,进一步提高了16%。
引用
@article{arxiv.2401.13921,
title = {Intelli-Z: Toward Intelligible Zero-Shot TTS},
author = {Sunghee Jung and Won Jang and Jaesam Yoon and Bongwan Kim},
journal= {arXiv preprint arXiv:2401.13921},
year = {2024}
}