基于置换不变训练的单通道多说话人语音识别
声音
2018-12-06 v1 计算与语言
机器学习
音频与语音处理
摘要
尽管自动语音识别(ASR)取得了巨大进展,但在识别多说话人混合语音时仍观察到显著的性能下降。本文提出并评估了几种架构,以在仅有一个混合信号通道可用的假设下解决此问题。我们的技术扩展了置换不变训练(PIT),引入了基于最小均方误差(MSE)准则的前端特征分离模块和基于最小交叉熵(CE)准则的后端识别模块。具体而言,在训练过程中,我们针对每种可能的整句输出-目标分配,计算整句的平均MSE或CE,选择具有最小MSE或CE的分配,并针对该分配进行优化。该策略优雅地解决了基于深度学习的多说话人混合语音分离与识别系统中观察到的标签置换问题。所提出的架构在人工混合的AMI数据集上进行了评估和比较,包含两人和三人混合语音。实验结果表明,当说话人能量相当时,对于两人和三人混合语音,我们提出的架构相对于最先进的单说话人语音识别系统,在所有说话人上的词错误率(WER)分别相对降低了45.0%和25.0%。据我们所知,这是首个针对具有挑战性的说话人无关、自发、大词汇量连续语音任务的多说话人混合语音识别工作。
引用
@article{arxiv.1707.06527,
title = {Single-Channel Multi-talker Speech Recognition with Permutation Invariant Training},
author = {Yanmin Qian and Xuankai Chang and Dong Yu},
journal= {arXiv preprint arXiv:1707.06527},
year = {2018}
}
备注
11 pages, 6 figures, Submitted to IEEE/ACM Transactions on Audio, Speech and Language Processing. arXiv admin note: text overlap with arXiv:1704.01985