基于扩展复高斯混合模型的多说话人 MVDR 波束形成
音频与语音处理
2019-10-18 v1
摘要
在这封信中,我们提出了一种新颖的多说话人最小方差无失真响应(MVDR)波束形成器,作为晚宴场景下自动语音识别(ASR)系统的前端。我们选用 CHiME-5 数据集来评估我们的方案在具有严重噪声的重叠多说话人场景下的表现。基于所提出的扩展复高斯混合模型(CGMM),并结合各种语音分离和语音增强掩码,我们对波束形成进行了详细研究。为将原始基于 CGMM 的 MVDR 应用于多说话人场景,我们做了三处主要修改。首先,将高斯分布的数量扩展到 3,并增加了一个额外的推理说话人模型。其次,引入混合系数作为监督器,以生成更精细的掩码并避免置换问题。此外,我们重新组织了 MVDR 和基于掩码的语音分离,以实现降噪和目标说话人提取的双重目的。使用官方基线 ASR 后端,我们的前端算法相比基线前端取得了 13.87% 的绝对词错误率(WER)降低。
引用
@article{arxiv.1910.07753,
title = {Multi-Talker MVDR Beamforming Based on Extended Complex Gaussian Mixture Model},
author = {Hangting Chen and Pengyuan Zhang and Yonghong Yan},
journal= {arXiv preprint arXiv:1910.07753},
year = {2019}
}