中文

用于 DNN 说话人自适应训练的嵌入

计算与语言 2019-10-01 v1 声音 音频与语音处理

摘要

本工作中,我们研究在每位说话人少量自适应数据情形下,将嵌入用于 DNN 说话人自适应训练(DNN-SAT)的方法。DNN-SAT 可视为学习从每个嵌入到应用于 DNN 共享参数的变换参数的映射。我们研究应用这些变换的不同方法,发现配合良好的训练策略,作用于所有隐藏层的多层自适应网络并不比作用于嵌入以变换输入特征的单个线性层更有效。工作的第二部分,我们在额外的说话人识别任务中评估不同嵌入(i-vectors、x-vectors 与深度 CNN 嵌入),以洞察何种特性应刻画用于 DNN-SAT 的嵌入。我们发现给定表示的说话人识别性能与其 ASR 性能不相关;事实上,相比仅捕获说话人身份能捕获更多语音属性才是高效 DNN-SAT ASR 嵌入的最重要特征。我们的最佳模型相较使用说话人级倒谱均值归一化(CMN)的 DNN 基线及完全说话人无关模型,分别取得了 4% 与 9% 的相对 WER 增益。

关键词

引用

@article{arxiv.1909.13537,
  title  = {Embeddings for DNN speaker adaptive training},
  author = {Joanna Rownicka and Peter Bell and Steve Renals},
  journal= {arXiv preprint arXiv:1909.13537},
  year   = {2019}
}

备注

Accepted at ASRU 2019