中文

评估长文本语音合成:句子与段落评分的比较

音频与语音处理 2019-09-10 v1 计算与语言 机器学习 声音

摘要

文本到语音系统通常在单句上评估。当考虑长文本形式的内容(例如由完整段落或对话组成的数据)时,孤立地评估句子并不总是合适的,因为句子被合成所处的上下文缺失了。在本文中,我们研究了三种不同的评估长文本语音合成自然度的方法。我们比较了孤立评估句子、评估整段语音以及提供一段语音或文本作为上下文并评估后续语音所得的结果。我们发现,尽管这三种评估基于相同材料,但结果因设置而异,而且这些结果彼此之间未必相关。我们表明我们的发现在单人朗读段落设置与双人对话场景之间是一致的。我们得出结论:要评估长文本语音的质量,传统的孤立评估句子的方式并不充分,且需要多种评估。

关键词

引用

@article{arxiv.1909.03965,
  title  = {Evaluating Long-form Text-to-Speech: Comparing the Ratings of Sentences and Paragraphs},
  author = {Rob Clark and Hanna Silen and Tom Kenter and Ralph Leith},
  journal= {arXiv preprint arXiv:1909.03965},
  year   = {2019}
}

备注

Accepted for The 10th ISCA Speech Synthesis Workshop (SSW10), 6 pages