中文

面向基于神经换能器的目标说话人语音识别的知识蒸馏:利用并行混合/单说话人语音数据

音频与语音处理 2023-05-26 v1

摘要

基于神经换能器(RNNT)的目标说话人语音识别(TS-RNNT)直接从多说话人混合语音中转录目标说话人的声音。它是一种很有前景的流式应用方案,因为它不会产生目标语音提取前端带来的额外计算成本,而这是快速响应的关键障碍。TS-RNNT在给定输入语音(即混合语音与注册语音)和参考转录文本的条件下进行端到端训练。训练混合语音通常通过混合单说话人信号来模拟,但传统的TS-RNNT训练并未利用单说话人信号。本文提出使用知识蒸馏(KD)来利用并行的混合/单说话人语音数据。我们提出的KD方案使用以目标单说话人语音输入预训练的RNNT系统为TS-RNNT训练生成伪标签。实验结果表明,采用所提KD方案训练的TS-RNNT系统优于基线TS-RNNT。

关键词

引用

@article{arxiv.2305.15971,
  title  = {Knowledge Distillation for Neural Transducer-based Target-Speaker ASR: Exploiting Parallel Mixture/Single-Talker Speech Data},
  author = {Takafumi Moriya and Hiroshi Sato and Tsubasa Ochiai and Marc Delcroix and Takanori Ashihara and Kohei Matsuura and Tomohiro Tanaka and Ryo Masumura and Atsunori Ogawa and Taichi Asami},
  journal= {arXiv preprint arXiv:2305.15971},
  year   = {2023}
}

备注

Accepted to Interspeech 2023