中文

理解 Frechet 语音距离用于合成语音质量评估

声音 2026-01-30 v1 人工智能

摘要

合成语音质量的客观评估仍是一个关键挑战。人类听力测试是黄金标准,但成本高昂且在大规模情况下不实用。Frechet 距离已成为一个有前景的替代方案,但其可靠性高度依赖于嵌入特征的选择和实验设置。在本工作中,我们全面评估了 Frechet 语音距离 (FSD) 及其变体语音最大均值偏差 (SMMD),并在不同嵌入特征和条件下进行测试。我们进一步将人类听力评估纳入,同时结合TTS的语音清晰度和合成训练的ASR词错误率 (WER),以验证这些指标的感知相关性。我们的发现表明,WavLM Base+ 特征与人类评分的最稳定对齐。虽然FSD和SMMD无法完全取代主观评估,但我们表明它们可以作为补充、成本效益高且可重复的措施,特别适用于大规模或无法进行直接听力评估的场景。代码已公开于 https://github.com/kaen2891/FrechetSpeechDistance。

关键词

引用

@article{arxiv.2601.21386,
  title  = {Understanding Frechet Speech Distance for Synthetic Speech Quality Evaluation},
  author = {June-Woo Kim and Dhruv Agarwal and Federica Cerina},
  journal= {arXiv preprint arXiv:2601.21386},
  year   = {2026}
}

备注

accepted to ICASSP 2026