中文

基于多假设的序列级自学习

计算与语言 2021-12-23 v1 人工智能 机器学习 音频与语音处理

摘要

本工作中,我们开发了基于注意力的序列到序列(seq2seq)模型用于自动语音识别(ASR)的新自学习技术。对于无转录语音数据,必须使用 ASR 系统的假设作为标签。然而,不完美的 ASR 结果使得无监督学习难以持续提升识别性能,尤其在无法获得多个强大教师模型的情况下。与常规无监督学习方法不同,我们采用\emph{多任务学习}(MTL)框架,其中第 nn 佳 ASR 假设用作每个任务的标签。seq2seq 网络通过 MTL 框架更新,以寻找能覆盖多个假设的公共表示。由此,可缓解\emph{硬决策}错误的影响。我们首先在美国与英国英语语音间的口音自适应任务中通过 ASR 实验证明了自学习方法的有效性。实验结果显示,与仅使用美国英语数据训练的基线模型相比,我们的方法将英国语音数据上的 WER 从 14.55\% 降至 10.36\%。此外,我们在联邦学习场景中研究了所提方法的效果。

关键词

引用

@article{arxiv.2112.05826,
  title  = {Sequence-level self-learning with multiple hypotheses},
  author = {Kenichi Kumatani and Dimitrios Dimitriadis and Yashesh Gaur and Robert Gmyr and Sefik Emre Eskimez and Jinyu Li and Michael Zeng},
  journal= {arXiv preprint arXiv:2112.05826},
  year   = {2021}
}

备注

Published in Interspeech 2020: https://www.isca-speech.org/archive_v0/Interspeech_2020/pdfs/2020.pdf