中文

基于注意力说话人记忆的无监督说话人自适应端到端ASR方法

音频与语音处理 2020-02-17 v1 计算与语言 机器学习 声音

摘要

我们提出了一种受神经图灵机启发、用于端到端(E2E)自动语音识别(ASR)的无监督说话人自适应方法。所提模型包含一个记忆块,其中保存从训练数据中提取的说话人i-vector,并通过注意力机制从记忆中读取相关的i-vector。得到的记忆向量(M-vector)被拼接至E2E神经网络模型的声学特征或隐藏层激活上。该E2E ASR系统基于联合连接主义时序分类与基于注意力的编码器-解码器架构。使用WSJ和TED-LIUM2 ASR基准,我们比较了将M-vector与i-vector插入编码器神经网络不同层的结果。我们表明,在测试时不需要辅助说话人嵌入提取系统的M-vector,对单说话人语句取得了与i-vector相近的词错误率(WER),而对包含说话人切换的语句取得了显著更低的WER。

关键词

引用

@article{arxiv.2002.06165,
  title  = {Unsupervised Speaker Adaptation using Attention-based Speaker Memory for End-to-End ASR},
  author = {Leda Sarı and Niko Moritz and Takaaki Hori and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2002.06165},
  year   = {2020}
}

备注

To appear in Proc. ICASSP 2020