中文

基于指标的方法为语音合成系统进行语音映射

音频与语音处理 2026-05-05 v1 人工智能 信号处理

摘要

本研究探讨了将语音映射作为文本语音合成(TTS)语音质量评估的框架。该研究分析了六种 TTS 模型,包括历史模型和近期模型。指标包括 crest factor、频谱平衡和语音峰显现性(CPPs)。我们研究了6个有影响力的 TTS 模型:Merlin、Tacotron 2、Transformer TTS、FastSpeech 2、Glow-TTS 和 VITS。结果表明,语音范围是模型能力的主要指标,VITS 在所测试模型中表现出最大的语音范围。Glow-TTS 在软音功能方面表现优异,由更高的频谱平衡指示,尽管其语音范围有限。结果显示,CPPs 在 7-8 dB 之间的值表明自然语音质量,而当 CPPs 超过 10 dB 时,语音倾向于呈机器人样。这些发现凸显了进行语音映射评估 vocal effort 的需要,捕捉 TTS 系统如何处理语音动态和表达性的能力。

关键词

引用

@article{arxiv.2605.00861,
  title  = {Voice Mapping of Text-to-Speech Systems: A Metric-Based Approach for Voice Quality Assessment},
  author = {Huanchen Cai and Sten Ternström},
  journal= {arXiv preprint arXiv:2605.00861},
  year   = {2026}
}