中文

利用来自非平行合格语音数据的替代软目标进行知识蒸馏

声音 2021-12-17 v1 音频与语音处理

摘要

本文描述了一种新颖的知识蒸馏框架,其将现有训练数据池中声学合格的语音数据作为特权信息加以利用。在我们提出的框架中,学生网络针对每句话训练多个软目标,这些软目标由原始说话人话语的主软目标,以及作为辅助视图的、在更佳声学条件下由其他说话人所说话语生成的替代目标组成。这些用于生成更佳软目标的其他说话人的合格话语,依据词/音素/状态时长方面的严格约束从合格数据池中收集。我们提出的方法是一种目标端数据增强形式,它利用从合格数据池获得的相应更佳软目标创建数据的多个副本。我们在声学模型自适应设定下的实验表明,所提方法利用从各说话人获得的更佳软目标,相比仅使用原始说话人软目标的常规方法可进一步提升识别准确率。

关键词

引用

@article{arxiv.2112.08878,
  title  = {Knowledge Distillation Leveraging Alternative Soft Targets from Non-Parallel Qualified Speech Data},
  author = {Tohru Nagano and Takashi Fukuda and Gakuto Kurata},
  journal= {arXiv preprint arXiv:2112.08878},
  year   = {2021}
}