中文

基于潜在狄利克雷分配的声音数据选择用于自动语音识别

计算与语言 2019-07-03 v1

摘要

从大量多样且域外数据中选取域内数据是一个重要问题。多数情况下,仅使用所有可用数据会导致次优,某些情况下甚至比精心选取匹配集合更差,即便对数据低效的神经网络模型亦如此。声学潜在狄利克雷分配(aLDA)已被证明在多种语音技术相关任务中有用,包括自动语音识别声学模型的域适应与信息检索的实体标注。本文我们提出在数据选择框架中将 aLDA 用作数据相似性准则。给定大量域外且可能不匹配的数据池,任务为选取与目标域中采样的代表性语句最匹配的训练数据。我们的目标数据约含 32 小时会议数据(远场与近场均有),数据池含 2k 小时会议、演讲、语音搜索、听写、命令控制、有声书、讲座、通用媒体与电话语音数据。所提训练数据选择技术显著优于随机选取、基于后验的选取以及使用所有可用数据。

关键词

引用

@article{arxiv.1907.01302,
  title  = {Latent Dirichlet Allocation Based Acoustic Data Selection for Automatic Speech Recognition},
  author = {Mortaza and Doulaty and Thomas Hain},
  journal= {arXiv preprint arXiv:1907.01302},
  year   = {2019}
}