中文

L-Vector:用于域适应的神经标签嵌入

音频与语音处理 2020-04-29 v1 计算与语言 机器学习 声音 机器学习

摘要

我们提出一种新颖的神经标签嵌入(NLE)方案,用于深度神经网络(DNN)声学模型在源域与目标域非配对数据样本下的域适应。借助 NLE 方法,我们将知识从一个强大的源域 DNN 提炼为一部标签嵌入词典,或称 l-vector,每个 senone 类对应一个。每个 l-vector 是源域 DNN 的 senone 特定输出分布的表示,并通过简单平均或标准反向传播学习,以最小化到具有相同标签的输出向量的平均 L2、Kullback-Leibler(KL)或对称 KL 距离。在适应过程中,l-vector 作为软目标,以交叉熵损失训练目标域模型。不同于教师-学生学习中所需的并行数据约束,NLE 特别适用于无法从源域数据模拟出配对目标域数据的情况。我们将一个 6400 小时多条件美式英语声学模型适应到 9 种带口音英语(80 至 830 小时)与儿童语音(80 小时)各自的域上。相较使用 one-hot 标签的直接重训练,NLE 实现了最高 14.1% 的相对词错误率下降。

关键词

引用

@article{arxiv.2004.13480,
  title  = {L-Vector: Neural Label Embedding for Domain Adaptation},
  author = {Zhong Meng and Hu Hu and Jinyu Li and Changliang Liu and Yan Huang and Yifan Gong and Chin-Hui Lee},
  journal= {arXiv preprint arXiv:2004.13480},
  year   = {2020}
}

备注

5 pages, 2 figure, ICASSP 2020