中文

用于联合语音分离与识别的混合编码器

计算与语言 2023-06-22 v1 机器学习

摘要

多说话人自动语音识别(ASR)对许多实际应用至关重要,但其需要专门的建模技术。现有方法可分为模块化与端到端两类。模块化方法先分离说话人,再用单说话人 ASR 系统分别识别。端到端模型在单一强大神经网络中直接处理重叠语音。本文提出一种折中方法:类似于模块化方法利用显式语音分离,同时将混合语音信息直接引入 ASR 模块,以减轻语音分离器所产生错误的传播。我们还探索了一种通过组合各说话人信息的层来交换跨说话人上下文信息的方式。我们的系统经分离与联合训练阶段优化,在 SMS-WSJ 任务上相较纯模块化设置取得了 7% 的词错误率相对提升。

关键词

引用

@article{arxiv.2306.12173,
  title  = {Mixture Encoder for Joint Speech Separation and Recognition},
  author = {Simon Berger and Peter Vieting and Christoph Boeddeker and Ralf Schlüter and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2306.12173},
  year   = {2023}
}

备注

Accepted at Interspeech 2023