中文

深度聚类作为稀疏重叠语音自动语音识别预处理的分析

声音 2019-09-26 v2 计算与语言 音频与语音处理

摘要

当音频信号包含串扰时,自动语音识别(ASR)系统会出现显著的性能下降。最近提出的解决多说话人 ASR 问题的方法之一是深度聚类(DPCL)方法。将 DPCL 与最先进的混合声学模型结合,我们在常用的 wsj0-2mix 数据集上获得了 16.5% 的词错误率(WER),据我们所知这是迄今为止报道的最佳性能。wsj0-2mix 数据集包含模拟串扰,其中多个说话人的语音在几乎整个语句中重叠。在更现实的 ASR 场景中,音频信号包含大量的单说话人语音,仅部分信号包含多个竞争说话人的语音。本文研究了在此类稀疏重叠语音场景中应用 DPCL 作为 ASR 预处理方法的障碍。为此,我们提出了一种与 wsj0-2mix 数据集密切相关的数据模拟方法,生成任意重叠率的稀疏重叠语音数据集。将 DPCL 应用于稀疏重叠语音的分析,是介于完全重叠数据集(如 wsj0-2mix)与更现实的 ASR 数据集(如 CHiME-5 或 AMI)之间的重要中间步骤。

关键词

引用

@article{arxiv.1905.03500,
  title  = {Analysis of Deep Clustering as Preprocessing for Automatic Speech Recognition of Sparsely Overlapping Speech},
  author = {Tobias Menne and Ilya Sklyar and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:1905.03500},
  year   = {2019}
}