隐秘源:引入源特征以改进声学至发音语音反演
音频与语音处理
2022-11-01 v1 声音
摘要
在这项工作中,我们将声学导出的源特征——非周期性、周期性与音高——作为附加目标引入声学至发音语音反演(SI)系统。我们还提出了一种基于时间卷积的 SI 系统,其使用听觉谱图作为输入语音表示,以学习源与声道之间的长程依赖与复杂交互,从而改进 SI 任务。实验在 Wisconsin X-ray microbeam (XRMB) 与 Haskins Production Rate Comparison (HPRC) 数据集上进行,并与三种基线 SI 模型架构进行比较。当使用源特征作为附加目标时,所提出的 SI 系统在 HPRC 数据集上获得了接近 28% 的提升。同一 SI 系统在 XRMB 数据集上比当前最佳性能的 SI 模型高出约 9%。
引用
@article{arxiv.2210.16450,
title = {The Secret Source : Incorporating Source Features to Improve Acoustic-to-Articulatory Speech Inversion},
author = {Yashish M. Siriwardena and Carol Espy-Wilson},
journal= {arXiv preprint arXiv:2210.16450},
year = {2022}
}