中文

用于语音识别的声学编码器协同训练

计算与语言 2021-07-15 v2 声音 音频与语音处理

摘要

设备端语音识别需要训练不同大小的模型以部署在具有不同计算预算的设备上。在构建此类不同模型时,我们可受益于联合训练它们以利用它们之间共享的知识。联合训练也是高效的,因为它减少了训练流程中数据处理操作的冗余。我们提出一种用于语音识别的协同训练不同大小声学编码器的方法。我们使用序列转导器设置,其中不同声学编码器共享一个共同的预测器与连接模块。这些声学编码器还通过用于帧级chenone预测的辅助任务利用共蒸馏进行训练,同时结合转导器损失。我们使用LibriSpeech语料库进行实验,并证明协同训练的声学编码器在两个测试划分上均可提供高达11%的词错误率相对改进。

关键词

引用

@article{arxiv.2106.08960,
  title  = {Collaborative Training of Acoustic Encoders for Speech Recognition},
  author = {Varun Nagaraja and Yangyang Shi and Ganesh Venkatesh and Ozlem Kalinli and Michael L. Seltzer and Vikas Chandra},
  journal= {arXiv preprint arXiv:2106.08960},
  year   = {2021}
}

备注

INTERSPEECH 2021