中文

基于自回归预训练与跨语言音素感知建模的无监督子词建模

音频与语音处理 2020-10-30 v2 计算与语言 声音

摘要

本研究针对无监督子词建模,即学习能够区分语言子词单元的特征表示。所提方法采用两阶段瓶颈特征(BNF)学习框架,由作为前端的自回归预测编码(APC)和作为后端的 DNN-BNF 模型组成。APC 预训练特征被设为 DNN-BNF 模型的输入特征。使用语言不匹配的 ASR 系统为 DNN-BNF 模型训练提供跨语言音素标签。最后,提取 BNF 作为子词可区分的特征表示。本工作的第二个目标是考察我们所提方法的有效性对不同训练数据量的鲁棒性。在 Libri-light 和 ZeroSpeech 2017 数据库上的结果表明,APC 在前端特征预训练中是有效的。我们的整体系统在这两个数据库上均优于当前最优方法。由荷兰语 ASR 为英语数据提供的跨语言音素标签优于由普通话 ASR 提供的标签,这可能与荷兰语相较于普通话与英语更大的相似性有关。当训练数据超过 50 小时时,我们的系统对训练数据量较不敏感。APC 预训练使得所需训练材料从超过 5000 小时减少至约 200 小时,且性能下降很小。

关键词

引用

@article{arxiv.2007.13002,
  title  = {Unsupervised Subword Modeling Using Autoregressive Pretraining and Cross-Lingual Phone-Aware Modeling},
  author = {Siyuan Feng and Odette Scharenborg},
  journal= {arXiv preprint arXiv:2007.13002},
  year   = {2020}
}

备注

5 pages, 3 figures. Accepted for publication in INTERSPEECH 2020, Shanghai, China