中文

RedPen:非自然语音的区域与原因标注数据集

音频与语音处理 2022-10-27 v1 人工智能 计算与语言 声音

摘要

尽管语音合成模型近期取得了进展,但对此类模型的评估仍纯粹基于人类判断给出的单一自然度评分,例如平均意见分(MOS)。这种基于评分的指标无法提供关于语音的哪些部分不自然或人类评委认为其不自然的原因的任何进一步信息。我们提出了一个新颖的语音数据集 RedPen,其中包含对非自然语音区域及其对应原因的人工标注。RedPen 由 180 段带有众包工人标注的非自然区域合成语音组成;随后对这些区域进行原因分析并按错误类型(如声音颤抖和背景噪声)进行分类。我们发现,与模型驱动的非自然性预测相比,我们的数据集对非自然语音区域提供了更好的解释。我们的分析还表明,每个模型包含不同类型的错误。总而言之,我们的数据集成功地表明,在单一的自然度评分之下可能隐藏着各种错误区域和类型。我们相信,我们的数据集未来将为更具可解释性的语音模型的评估与开发带来启发。我们的数据集将在论文被接受后公开发布。

关键词

引用

@article{arxiv.2210.14406,
  title  = {RedPen: Region- and Reason-Annotated Dataset of Unnatural Speech},
  author = {Kyumin Park and Keon Lee and Daeyoung Kim and Dongyeop Kang},
  journal= {arXiv preprint arXiv:2210.14406},
  year   = {2022}
}

备注

Submitted to ICASSP 2023