中文

隐秘源:引入源特征以改进声学至发音语音反演

音频与语音处理 2022-11-01 v1 声音

摘要

在这项工作中,我们将声学导出的源特征——非周期性、周期性与音高——作为附加目标引入声学至发音语音反演(SI)系统。我们还提出了一种基于时间卷积的 SI 系统,其使用听觉谱图作为输入语音表示,以学习源与声道之间的长程依赖与复杂交互,从而改进 SI 任务。实验在 Wisconsin X-ray microbeam (XRMB) 与 Haskins Production Rate Comparison (HPRC) 数据集上进行,并与三种基线 SI 模型架构进行比较。当使用源特征作为附加目标时,所提出的 SI 系统在 HPRC 数据集上获得了接近 28% 的提升。同一 SI 系统在 XRMB 数据集上比当前最佳性能的 SI 模型高出约 9%。

关键词

引用

@article{arxiv.2210.16450,
  title  = {The Secret Source : Incorporating Source Features to Improve Acoustic-to-Articulatory Speech Inversion},
  author = {Yashish M. Siriwardena and Carol Espy-Wilson},
  journal= {arXiv preprint arXiv:2210.16450},
  year   = {2022}
}