中文

CTC 声学模型中用于半监督学习的知识蒸馏与数据选择

计算与语言 2020-08-11 v1 音频与语音处理

摘要

半监督学习(SSL)是一个活跃的研究领域,旨在利用无标签数据以提升语音识别系统的准确率。本研究提出一种融合两个关键思想的方法论:1)使用连接主义时序分类(CTC)目标与基于教师-学生的学习进行 SSL;2)设计有效的数据选择机制,以利用无标签数据提升学生模型性能。我们的目标在于确立基于置信度度量、说话人与内容变异性等属性从大量无标签数据池中选取样本的良好准则的重要性。我们试图回答的问题是:是否可能设计一种数据选择机制,在词错误率(WER)不妥协的前提下,减少对随机选取大规模无标签样本的依赖?我们对不同数据选择方法进行了实证探究以回答该问题,并量化了不同采样策略的影响。在具有 40000 小时精心筛选无标签数据的半监督 ASR 设定下,我们的 CTC-SSL 方法相较仅用有标签数据训练的基线 CTC 系统取得了 17% 的相对 WER 提升。其性能也与基于随机采样、使用数量级更大无标签数据训练的 CTC-SSL 系统相当。

关键词

引用

@article{arxiv.2008.03923,
  title  = {Knowledge Distillation and Data Selection for Semi-Supervised Learning in CTC Acoustic Models},
  author = {Prakhar Swarup and Debmalya Chakrabarty and Ashtosh Sapru and Hitesh Tulsiani and Harish Arsikere and Sri Garimella},
  journal= {arXiv preprint arXiv:2008.03923},
  year   = {2020}
}