结合非自回归Conformer CTC与条件说话人链的多说话人ASR
音频与语音处理
2021-06-17 v1 声音
摘要
非自回归(NAR)模型在各种序列到序列任务上已实现大幅推理计算削减并与自回归(AR)模型取得相当结果。然而,针对序列到多序列问题(如多说话人自动语音识别(ASR))探索NAR方法的研究有限。在本研究中,我们将所提出的条件链模型扩展至NAR多说话人ASR。具体而言,利用输入混合语音与先前估计的条件说话人特征,逐一推断每位说话人的输出。在每一步中,使用NAR连接时序分类(CTC)编码器执行并行计算。借助该设计,总推理步数将被限制为混合说话人数量。此外,我们还采用Conformer并引入中间CTC损失以提升性能。在WSJ0-Mix与LibriMix语料上的实验表明,我们的模型以仅略微增加的延迟优于其他NAR模型,分别取得22.3%与24.9%的WER。而且,通过纳入可变说话人数的数据,我们的模型甚至以仅1/7的延迟优于PIT-Conformer AR模型,在WSJ0-2mix与WSJ0-3mix集上分别获得19.9%与34.3%的WER。我们的所有代码公开于https://github.com/pengchengguo/espnet/tree/conditional-multispk。
引用
@article{arxiv.2106.08595,
title = {Multi-Speaker ASR Combining Non-Autoregressive Conformer CTC and Conditional Speaker Chain},
author = {Pengcheng Guo and Xuankai Chang and Shinji Watanabe and Lei Xie},
journal= {arXiv preprint arXiv:2106.08595},
year = {2021}
}
备注
Accepted by Interspeech 2021