中文

端到端音乐混合语音识别

音频与语音处理 2020-08-28 v1

摘要

多媒体内容中的自动语音识别(ASR)是有前景的应用之一,但此类内容中的语音数据经常与背景音乐混合,这对ASR性能有害。在本研究中,我们提出一种基于时域源分离的改进带背景音乐ASR的方法。我们利用Conv-TasNet作为分离网络,该网络在多说话人源分离中达到了最先进性能,用于从波形域中的语音-音乐混合中提取语音信号。我们还提出联合微调预训练的Conv-TasNet前端和基于注意力的ASR后端,同时使用分离和ASR目标。我们通过使用来自多种日本动画的背景音乐混合语音数据的ASR实验评估了我们的方法。我们表明,时域语音-音乐分离显著提高了使用混合数据训练的后端模型的ASR性能,联合优化进一步显著降低了词错误率(WER)。时域分离方法在简单级联和联合训练设置中均优于重用输入混合信号相位信息的频域分离方法。我们还证明了我们的方法对古典、爵士和流行音乐干扰具有鲁棒性。

关键词

引用

@article{arxiv.2008.12048,
  title  = {End-to-end Music-mixed Speech Recognition},
  author = {Jeongwoo Woo and Masato Mimura and Kazuyoshi Yoshii and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2008.12048},
  year   = {2020}
}

备注

Submitted to APSIPA 2020