基于乳酸流选取感知声音质量的语音合成 - 以颤音为例
音频与语音处理
2025-11-10 v1
摘要
控制文本转语音系统中感知声音质量在需要展示未加工及加工后语音探针的应用中具有重要意义,因为这类概念在其他情况下难以理解。本文表明,一种增强了基于乳酸流全局说话人属性操控块的语音合成系统,能够正确操控颤音这种非持久、局部化的声音质量,从而避免了通常不可靠的帧级颤音预测器。主观听感测试确认了颤音操控成功,但MOS 分数略低于原始录音。
引用
@article{arxiv.2511.05143,
title = {Synthesizing speech with selected perceptual voice qualities - A case study with creaky voice},
author = {Frederik Rautenberg and Fritz Seebauer and Jana Wiechmann and Michael Kuhlmann and Petra Wagner and Reinhold Haeb-Umbach},
journal= {arXiv preprint arXiv:2511.05143},
year = {2025}
}
备注
Proceedings of Interspeech