中文

基于师生学习的远场语音系统开发

计算与语言 2018-04-17 v1

摘要

在本研究中,我们开发了远场语音系统中的关键词唤醒(KWS)和声学模型(AM)组件。具体而言,我们使用师生(T/S)学习,通过并行的近讲数据和模拟远场数据,将近讲训练良好的生产 AM 适配到远场场景。我们还使用 T/S 学习将大尺寸 KWS 模型压缩为小尺寸模型,以适应设备的计算成本。无需转录文本,T/S 学习充分利用未转录数据来提升 AM 适配和 KWS 模型压缩中的模型性能。我们进一步通过序列判别训练和真实数据优化模型,以达到系统的最佳性能。适配后的 AM 在回放和实时测试数据上,相对词错率分别比基线降低了 72.60% 和 57.16%。最终的 KWS 模型尺寸从大尺寸 KWS 模型缩小了 27 倍,且未损失准确率。

关键词

引用

@article{arxiv.1804.05166,
  title  = {Developing Far-Field Speaker System Via Teacher-Student Learning},
  author = {Jinyu Li and Rui Zhao and Zhuo Chen and Changliang Liu and Xiong Xiao and Guoli Ye and Yifan Gong},
  journal= {arXiv preprint arXiv:1804.05166},
  year   = {2018}
}

备注

Accepted at ICASSP 2018