中文

说话人感知的语音Transformer

计算与语言 2020-01-07 v1 声音 音频与语音处理

摘要

近年来,端到端(E2E)模型成为传统混合自动语音识别(ASR)系统的一个有竞争力的替代方案。然而,它们仍受训练与测试条件间说话人不匹配的困扰。本文以Speech-Transformer(ST)为研究平台,探讨E2E模型的说话人感知训练。我们提出一种称为说话人感知语音Transformer(SAST)的模型,其为配备说话人注意力模块(SAM)的标准ST。SAM具有由i-vector构成的静态说话人知识块(SKB)。在每个时间步,编码器输出对该块中的i-vector进行注意力计算,生成加权组合的说话人嵌入向量,帮助模型归一化说话人变化。以此方式训练的SAST模型独立于特定训练说话人,从而更好地泛化至未见测试说话人。我们研究了SAM的不同因素。在AISHELL-1任务上的实验结果表明,SAST相较说话人无关(SI)基线实现了6.5%的相对字错率降低(CERR)。此外,我们证明即使SKB中的i-vector全部来自不同于声学训练集的数据源,SAST仍表现良好。

关键词

引用

@article{arxiv.2001.01557,
  title  = {Speaker-aware speech-transformer},
  author = {Zhiyun Fan and Jie Li and Shiyu Zhou and Bo Xu},
  journal= {arXiv preprint arXiv:2001.01557},
  year   = {2020}
}