中文

基于词格的神经网络声学模型无监督测试时自适应

计算与语言 2019-06-28 v1 声音 音频与语音处理

摘要

声学模型对未见测试录音的自适应旨在减少训练与测试条件之间的不匹配。大多数神经网络模型的自适应方案需要使用由未自适应模型生成的测试数据初始最佳转录,以估计自适应变换。已有研究发现,使用区分性目标函数(如交叉熵损失)的自适应方法通常需要仔细的正则化,以避免对最佳转录中的错误产生过拟合。本文通过使用第一遍解码获得的词格进行区分性自适应来解决此问题,该方法可无缝集成到无词格最大互信息(LF-MMI)框架中。我们在三个难度不同的转录任务上研究了该方法:TED 演讲、多体裁广播(MGB)和低资源语言(索马里语)。我们发现,所提出的方法能够在未观察到过拟合的情况下自适应更多参数,并且即使在初始转录的词错误率(WER)超过 50% 时也能成功。

关键词

引用

@article{arxiv.1906.11521,
  title  = {Lattice-Based Unsupervised Test-Time Adaptation of Neural Network Acoustic Models},
  author = {Ondrej Klejch and Joachim Fainberg and Peter Bell and Steve Renals},
  journal= {arXiv preprint arXiv:1906.11521},
  year   = {2019}
}