中文

REDAT:通过带重标注的域对抗训练实现端到端 ASR 的口音不变表示

音频与语音处理 2021-02-15 v2 人工智能 声音

摘要

口音不匹配是端到端 ASR 的一个关键问题。本文旨在通过构建具有域对抗训练(DAT)的口音鲁棒 RNN-T 系统来解决该问题。我们揭示了 DAT 背后的原理,并首次从理论上有保证地证明 DAT 学习口音不变表示。我们还证明,在 DAT 中执行梯度反转等价于最小化域输出分布之间的 Jensen-Shannon 散度。受等价性证明的启发,我们引入了 reDAT,一种基于 DAT 的新技术,它使用无监督聚类或软标签对数据进行重标注。在 23K 小时多口音数据上的实验表明,DAT 在母语和非母语英语口音上相较口音特定基线取得有竞争力的结果,而在未见口音上相对词错率(WER)降低高达 13%;我们的 reDAT 在美式与英式英语非母语口音上相对 DAT 进一步分别降低 3% 和 8%。

关键词

引用

@article{arxiv.2012.07353,
  title  = {REDAT: Accent-Invariant Representation for End-to-End ASR by Domain Adversarial Training with Relabeling},
  author = {Hu Hu and Xuesong Yang and Zeynab Raeesy and Jinxi Guo and Gokce Keskin and Harish Arsikere and Ariya Rastrow and Andreas Stolcke and Roland Maas},
  journal= {arXiv preprint arXiv:2012.07353},
  year   = {2021}
}

备注

accepted in ICASSP 2021; final camera-ready version