中文

面向低资源语言构建 ASR 的无监督域自适应方案

计算与语言 2021-09-17 v2 声音 音频与语音处理

摘要

从零构建自动语音识别(ASR)系统需要大量标注语音数据,这在许多语言中难以收集。然而,存在低资源语言与拥有足够标注数据可构建 ASR 的高资源语言共享声学空间的情况。在此类情形下,我们表明通过无监督域自适应(UDA)方案从高资源语言学到的域无关声学模型可提升低资源语言 ASR 的性能。我们以源域印地语与目标域梵语为具体示例。我们探索两种架构:i)使用梯度反转层(GRL)的域对抗训练,以及 ii)域分离网络(DSN)。当仅在目标域 5.5 小时数据上训练时,GRL 与 DSN 架构相较基线深度神经网络模型在词错误率上分别带来 6.71% 与 7.32% 的绝对提升。我们还表明在源域选取合适的语言(泰卢固语)可带来进一步改善。结果表明 UDA 方案有助于低资源语言 ASR 系统的开发,减轻收集大量标注语音数据的麻烦。

关键词

引用

@article{arxiv.2109.05494,
  title  = {Unsupervised Domain Adaptation Schemes for Building ASR in Low-resource Languages},
  author = {Anoop C S and Prathosh A P and A G Ramakrishnan},
  journal= {arXiv preprint arXiv:2109.05494},
  year   = {2021}
}

备注

Submitted to ASRU 2021