中文

对抗式说话人自适应

机器学习 2019-04-30 v1 计算与语言 声音 音频与语音处理 机器学习

摘要

我们提出了一种新颖的对抗式说话人自适应(ASA)方案,其中在自适应过程中应用对抗学习来正则化说话人相关(SD)深度神经网络(DNN)声学模型中的深度隐藏特征分布,使其接近固定的说话人无关(SI)DNN声学模型的特征分布。引入一个额外的判别器网络来区分由SD模型生成的深度特征与由SI模型生成的特征。在ASA中,以固定的SI模型作为参考,SD模型与判别器网络联合优化,以最小化senone分类损失,同时最小化-最大化自适应数据上的SI/SD判别损失。通过ASA,SD模型学习到与SI模型分布相似的、具有senone判别性的深度特征。借助这种正则化且自适应的深度特征,SD模型能够在目标说话人的语音上实现改进的自动语音识别。在Microsoft短消息听写数据集上评估,相较于用2600小时数据训练的SI模型,每位说话人200条自适应语句,ASA在有监督和无监督自适应上分别实现了14.4%和7.9%的相对词错误率提升。

关键词

引用

@article{arxiv.1904.12407,
  title  = {Adversarial Speaker Adaptation},
  author = {Zhong Meng and Jinyu Li and Yifan Gong},
  journal= {arXiv preprint arXiv:1904.12407},
  year   = {2019}
}

备注

5 pages, 2 figures, ICASSP 2019