用于域不变语音识别的原始语音特征对抗学习
音频与语音处理
2018-05-23 v1 声音
摘要
基于神经网络的声学建模近期进展显示出自动语音识别(ASR)性能的显著提升。为使声学模型能够处理较大的声学变化,需要大量标注数据,而这些数据往往获取代价高昂。本文探索应用对抗训练从原始语音中学习对声学变化不变的特征。本文将此种声学变化称为域偏移。本文所呈现的实验研究利用了域对抗神经网络(DANNs)[1] 的架构,其使用来自两个不同域的数据。DANN 是一种 Y 形网络,由一个多层 CNN 特征提取器模块构成,该模块为标签(senone)分类器与所谓的域分类器所共用。DANN 的效用在多个具有因性别与说话人口音差异所致域偏移的数据集上进行了评估。令人鼓舞的实证结果表明了对抗训练在 ASR 无监督域适应中的优势,从而强调了 DANN 从原始语音中学习域不变特征的能力。
引用
@article{arxiv.1805.08615,
title = {Adversarial Learning of Raw Speech Features for Domain Invariant Speech Recognition},
author = {Aditay Tripathi and Aanchan Mohan and Saket Anand and Maneesh Singh},
journal= {arXiv preprint arXiv:1805.08615},
year = {2018}
}
备注
5 pages, 1 figure, 2 tabels, ICASSP 2018