Vox-Evaluator:用于零样法语TTS的多级评估器以增强稳定性和保真度
声音
2025-10-24 v1
摘要
近期进展推动了零样文本到语音(TTS),受语言模型、扩散模型和掩码生成驱动,已在语音合成中实现惊人的自然性。然而,稳定性和保真度仍是关键挑战,表现为误读、可听见的噪声和质量下降。为解决这些问题,我们引入Vox-Evaluator,一个多级评估器,用于指导纠正错误的语音段并进行偏好对齐,以增强TTS系统的稳定性和保真度。它能够识别错误语音段的时间边界并提供对生成语音的整体质量评估。具体而言,为了细化错误段并增强零样TTS模型的鲁棒性,我们提出自动识别声学错误、屏蔽错误段,最后以正确片段为条件重新生成语音。此外,来自Vox-Evaluator的细粒度信息可用于指导TTS模型的偏好对齐,从而减少语音合成中的差异情况。由于缺乏适合Vox-Evaluator的训练数据集,我们还构建了一个标注了细粒度发音错误或音频质量问题的合成文本语音数据集。实验结果表明,提出的Vox-Evaluator通过语音纠正机制和偏好优化,有效增强了TTS系统的稳定性和保真度。演示已展示。
引用
@article{arxiv.2510.20210,
title = {Vox-Evaluator: Enhancing Stability and Fidelity for Zero-shot TTS with A Multi-Level Evaluator},
author = {Hualei Wang and Na Li and Chuke Wang and Shu Wu and Zhifeng Li and Dong Yu},
journal= {arXiv preprint arXiv:2510.20210},
year = {2025}
}
备注
10 pages, 5 figures