带精炼的多通道目标说话人提取:WavLab在第二届Clarity增强挑战赛中的提交
音频与语音处理
2023-02-17 v1 声音
信号处理
摘要
本文描述我们向第二届Clarity增强挑战赛(CEC2)的提交,该任务为在含音乐与竞争说话人等多干扰源的噪声混响环境中为助听(HA)设备进行目标语音增强。我们的方法基于近期工作引入的强大迭代神经/波束形成增强(iNeuBe)框架,本文将其扩展用于目标说话人提取。因此我们命名所提方法为iNeuBe-X,其中X代表提取。为应对CEC2设定中遇到的挑战,我们引入四项主要创新:(1) 我们将最初为单通道说话人分离设计的先进TF-GridNet模型扩展至多通道因果语音增强,并用此新架构替换iNeuBe中使用的TCNDenseNet,观察到大幅改进;(2) 我们利用近期双窗长与未来帧预测方法确保iNueBe-X满足CEC2要求的5 ms算法延迟约束;(3) 我们为TF-GridNet引入新颖说话人条件分支以实现目标说话人提取;(4) 我们提出微调步骤,针对经听者测听图补偿的目标说话人信号计算额外损失。在不使用外部数据的情况下,于官方开发集上我们最佳模型达到助听语音感知指数(HASPI)得分0.942与尺度不变信号失真比改善(SI-SDRi)18.8 dB。鉴于CEC2数据极具挑战性(如开发集上混合SI-SDR为-12.3 dB),这些结果令人鼓舞。我们提交系统的演示见WAVLab CEC2 demo。
引用
@article{arxiv.2302.07928,
title = {Multi-Channel Target Speaker Extraction with Refinement: The WavLab Submission to the Second Clarity Enhancement Challenge},
author = {Samuele Cornell and Zhong-Qiu Wang and Yoshiki Masuyama and Shinji Watanabe and Manuel Pariente and Nobutaka Ono},
journal= {arXiv preprint arXiv:2302.07928},
year = {2023}
}