语音合成中解耦音高和嘶哑声:保持说话人身份
音频与语音处理
2026-02-17 v1
摘要
我们引入了一个能够忠实修改嘶哑声感知质量的系统,同时保持说话人的感知身份。虽然已知高嘶哑概率通常与低音高相关,但这一现象是在多个说话人群体中观察到的属性,并不一定在所有情境下都成立。通过在语音合成系统训练数据集上进行数据增强,并基于条件连续正规化流引入说话人操控模块,实现了音高与嘶哑声的解耦。实验表明,在 various 嘶哑操控强度下,说话人验证性能显著提升。
引用
@article{arxiv.2602.14686,
title = {Disentangling Pitch and Creak for Speaker Identity Preservation in Speech Synthesis},
author = {Frederik Rautenberg and Jana Wiechmann and Petra Wagner and Reinhold Haeb-Umbach},
journal= {arXiv preprint arXiv:2602.14686},
year = {2026}
}