中文

基于置换不变训练的多说话人语音识别

声音 2018-12-06 v4 机器学习 音频与语音处理

摘要

在本文中,我们提出了一种新技术,在给定单通道混合语音的情况下直接识别多个语音流,而无需先将它们分离。我们的技术基于用于自动语音识别(ASR)的置换不变训练(PIT)。在 PIT-ASR 中,我们针对每个可能的输出-目标分配计算整个话语中所有帧的平均交叉熵(CE),选取具有最小 CE 的分配,并针对该分配进行优化。PIT-ASR 强制同一说话人的所有帧与同一输出层对齐。该策略优雅地一次性解决了标签置换问题和说话人追踪问题。我们在人工混合的 AMI 数据上的实验表明,所提出的方法非常有前景。

关键词

引用

@article{arxiv.1704.01985,
  title  = {Recognizing Multi-talker Speech with Permutation Invariant Training},
  author = {Dong Yu and Xuankai Chang and Yanmin Qian},
  journal= {arXiv preprint arXiv:1704.01985},
  year   = {2018}
}

备注

5 pages, 6 figures, InterSpeech2017