中文

声学至发音运动反演模型的独立自动评估

音频与语音处理 2019-11-25 v1 计算与语言 声音

摘要

从声学语音信号重建发音轨迹已被提出用于改进语音识别与文本到语音合成。然而,要在这些场景中发挥作用,发音重建必须具有说话人无关性。此外,由于多数研究聚焦于少量说话人的单一小型数据集,鲁棒的发音重建可受益于数据集的合并。均方根误差与 Pearson 相关系数等标准评估度量不适用于评估模型的说话人无关性或合并数据集的效用。我们提出了一种独立于所用训练发音数据集的发音重建新评估方法:音素区分 ABX 任务。我们使用 ABX 度量评估了一个基于 Bi-LSTM、在 3 个数据集(14 位说话人)上训练的模型,并表明它提供了对标准度量的补充信息,使我们能够评估数据集合并的效果以及模型的说话人无关性。

关键词

引用

@article{arxiv.1911.06573,
  title  = {Independent and automatic evaluation of acoustic-to-articulatory inversion models},
  author = {Maud Parrot and Juliette Millet and Ewan Dunbar},
  journal= {arXiv preprint arXiv:1911.06573},
  year   = {2019}
}

备注

5 pages, 1 figure