中文

利用跨语言说话人与音素多样性进行无监督子词建模

音频与语音处理 2019-10-01 v2 计算与语言

摘要

本研究解决了缺乏转写训练数据的低资源语言的声学建模问题。目标是学习鲁棒的帧级特征表示,可用于识别和区分子词级语音单元。所提出的特征表示包含多种类型的多语言瓶颈特征(BNF),这些特征通过深度神经网络的多任务学习(MTL-DNN)获得。关键问题之一是如何为未转写训练数据获取高质量帧标签以促进有监督的 DNN 训练。研究表明,通过有效利用来自一个或多个域外(资源丰富的)语言的转写语音数据和训练良好的自动语音识别(ASR)系统,可以实现鲁棒 BNF 表示的学习。域外 ASR 系统可应用于对目标语言的未转写训练数据进行说话人自适应,并将训练语音解码为帧级标签用于 DNN 训练。还发现,在执行帧聚类时考虑语音的时间依赖性可生成更好的帧标签。所提出的特征学习方法在 ZeroSpeech 2017 挑战赛 Track 1 的无监督子词建模标准任务上进行了评估。我们的系统取得的最佳性能为跨说话人三音子最小对 ABX 错误率 9.7%9.7\%,与近期报道的最佳系统相当。最后,我们的研究表明,目标语言与域外语言之间的相近程度以及各目标语言可用训练数据的数量可能对所学特征的质量有显著影响。

关键词

引用

@article{arxiv.1908.03538,
  title  = {Exploiting Cross-Lingual Speaker and Phonetic Diversity for Unsupervised Subword Modeling},
  author = {Siyuan Feng and Tan Lee},
  journal= {arXiv preprint arXiv:1908.03538},
  year   = {2019}
}

备注

12 pages, 6 figures. Manuscript published in the IEEE/ACM Transactions on Audio, Speech and Language Processing (Volume: 27 , Issue: 12 , Dec. 2019)