中文

基于图的时间分类的半监督语音识别

机器学习 2021-02-17 v2 计算与语言 声音 音频与语音处理

摘要

半监督学习通过使用种子 ASR 模型为无标签数据生成伪标签并进行自训练,在自动语音识别(ASR)中已展现出有前景的结果。该方法的有效性很大程度上依赖于伪标签的准确性,通常仅使用 1-best ASR 假设。然而,N-best 列表中的替代 ASR 假设可为无标签语音片段提供更准确的标签,并反映种子 ASR 模型的不确定性。本文中,我们提出了连接主义时间分类(CTC)目标的广义形式,其接受训练标签的图表示。新提出的基于图的时间分类(GTC)目标被应用于基于 WFST 监督的自训练,该监督由伪标签的 N-best 列表生成。在此设置中,GTC 不仅用于学习时间对齐(类似于 CTC),还用于学习标签对齐以从加权图中获得最优伪标签序列。结果表明,该方法能有效利用带关联分数的伪标签 N-best 列表,显著优于标准伪标注,其 ASR 结果接近人工选取 N-best 列表中最佳假设的 oracle 实验。

关键词

引用

@article{arxiv.2010.15653,
  title  = {Semi-Supervised Speech Recognition via Graph-based Temporal Classification},
  author = {Niko Moritz and Takaaki Hori and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2010.15653},
  year   = {2021}
}

备注

ICASSP 2021