对抗式说话人自适应
机器学习
2019-04-30 v1 计算与语言
声音
音频与语音处理
机器学习
摘要
我们提出了一种新颖的对抗式说话人自适应(ASA)方案,其中在自适应过程中应用对抗学习来正则化说话人相关(SD)深度神经网络(DNN)声学模型中的深度隐藏特征分布,使其接近固定的说话人无关(SI)DNN声学模型的特征分布。引入一个额外的判别器网络来区分由SD模型生成的深度特征与由SI模型生成的特征。在ASA中,以固定的SI模型作为参考,SD模型与判别器网络联合优化,以最小化senone分类损失,同时最小化-最大化自适应数据上的SI/SD判别损失。通过ASA,SD模型学习到与SI模型分布相似的、具有senone判别性的深度特征。借助这种正则化且自适应的深度特征,SD模型能够在目标说话人的语音上实现改进的自动语音识别。在Microsoft短消息听写数据集上评估,相较于用2600小时数据训练的SI模型,每位说话人200条自适应语句,ASA在有监督和无监督自适应上分别实现了14.4%和7.9%的相对词错误率提升。
引用
@article{arxiv.1904.12407,
title = {Adversarial Speaker Adaptation},
author = {Zhong Meng and Jinyu Li and Yifan Gong},
journal= {arXiv preprint arXiv:1904.12407},
year = {2019}
}
备注
5 pages, 2 figures, ICASSP 2019