中文

面向合成语音的帧级质量预测

音频与语音处理 2025-10-10 v2

摘要

虽然自动主观语音质量评估取得了显著进展,但是否存在可能在帧分辨率上进行自动质量评估仍是一个开放问题。这种做法高度可取,因为它为语音合成系统的评估提供了可解释性。本文首次针对该目标采取行动,通过识别现有质量预测器阻止进行合理帧级预测的缺陷。进一步地,我们定义了帧级预测器应满足的准则。我们还建议采用块级处理,以避免局部失真对相邻帧评分的影响。最后,我们在使用局部人工失真进行实验中,测量了一组帧级质量预测器的局部分辨性能,结果表明它们能够超越来自众所云集主观感知实验的人类注释的检测性能。

关键词

引用

@article{arxiv.2508.10374,
  title  = {Towards Frame-level Quality Predictions of Synthetic Speech},
  author = {Michael Kuhlmann and Fritz Seebauer and Petra Wagner and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2508.10374},
  year   = {2025}
}

备注

Proceedings of Interspeech