中文

引导 CTC 后验尖峰时序以改进后验融合与知识蒸馏

计算与语言 2019-07-03 v2 人工智能

摘要

从帧级对齐训练的传统自动语音识别(ASR)系统可轻松利用后验融合来提高 ASR 准确率,并通过知识蒸馏构建更好的单一模型。使用连接时序分类(CTC)损失训练的端到端 ASR 系统不需要帧级对齐,从而简化了模型训练。然而,CTC 模型稀疏且任意的后验尖峰时序给多模型后验融合和 CTC 模型间知识蒸馏带来了一系列新挑战。我们提出一种训练 CTC 模型的方法,使其尖峰时序被引导而与预训练的引导 CTC 模型对齐。因此,所有共享同一引导模型的模型都具有对齐的尖峰时序。我们在多种场景下展示了方法的优势,包括 CTC 模型的后验融合和不同架构 CTC 模型间的知识蒸馏。在 300 小时 Switchboard 训练数据下,从多模型蒸馏出的单一词级 CTC 模型在 Hub5 2000 Switchboard/CallHome 测试集上无需使用任何数据增强、语言模型或复杂解码器,便将词错误率从 14.9%/24.1% 降低到 13.7%/23.1%。

关键词

引用

@article{arxiv.1904.08311,
  title  = {Guiding CTC Posterior Spike Timings for Improved Posterior Fusion and Knowledge Distillation},
  author = {Gakuto Kurata and Kartik Audhkhasi},
  journal= {arXiv preprint arXiv:1904.08311},
  year   = {2019}
}

备注

Accepted to Interspeech 2019