中文

利用域对抗训练改进说话人无关的唇语识别

计算机视觉与模式识别 2017-08-07 v1 计算与语言

摘要

我们提出了一种唇语识别系统,即仅使用视觉特征的语音识别系统,该系统利用域对抗训练实现说话人无关性。域对抗训练被集成到基于前馈和LSTM(长短期记忆)递归神经网络堆叠的唇语识别器优化过程中,形成一个端到端可训练系统,该系统仅需极少量的未转录目标说话人数据帧,即可显著提升对目标说话人的识别准确率。在不同的源说话人和目标说话人配对中,仅使用15到20秒的未转录目标语音数据,我们就实现了约40%的相对准确率提升。在多说话人训练设置下,准确率提升幅度较小,但仍然显著。

关键词

引用

@article{arxiv.1708.01565,
  title  = {Improving Speaker-Independent Lipreading with Domain-Adversarial Training},
  author = {Michael Wand and Juergen Schmidhuber},
  journal= {arXiv preprint arXiv:1708.01565},
  year   = {2017}
}

备注

Accepted at Interspeech 2017