中文

基于蒸馏 BERT 模型的统一普通话 TTS 前端

声音 2021-01-01 v1 计算与语言

摘要

典型普通话文本转语音系统(TTS)中的前端模块由一长串文本处理组件构成,其构建需耗费大量精力,且易出现模型规模累积过大与级联错误。本文提出一种基于预训练语言模型(PLM)的模型,同时处理 TTS 前端中两项最重要的任务,即韵律结构预测(PSP)与字素到音素(G2P)转换。我们使用预训练的中文 BERT[1] 作为文本编码器,并采用多任务学习技术使其适配这两项 TTS 前端任务。随后,通过称为 TinyBERT[2] 的知识蒸馏技术将 BERT 编码器蒸馏为更小的模型,使整体模型规模为基准流水线模型的 25%,同时在两项任务上保持有竞争力的性能。借助所提方法,我们得以轻量且统一的方式运行整个 TTS 前端模块,更利于在移动设备上部署。

关键词

引用

@article{arxiv.2012.15404,
  title  = {Unified Mandarin TTS Front-end Based on Distilled BERT Model},
  author = {Yang Zhang and Liqun Deng and Yasheng Wang},
  journal= {arXiv preprint arXiv:2012.15404},
  year   = {2021}
}

备注

5 pages