中文

X-SepFormer:具有显式说话人混淆优化的端到端说话人提取网络

音频与语音处理 2023-03-10 v1 人工智能 声音

摘要

目标语音提取(TSE)系统旨在从多说话人混合语音中提取目标语音。大多数先前TSE网络的流行训练目标是提升提取语音波形的重构性能。然而,有报告指出,重构性能高的TSE系统在实践中仍可能存在低质量体验问题。此类体验问题之一是错误说话人提取(称为说话人混淆,SC),其导致强烈的负面体验并妨碍有效对话。为缓解这一紧迫的SC问题,我们重新制定训练目标,提出两种新颖的损失方案,其探索了在小块级别定义的重构改进性能度量,并利用该度量相关的分布信息。两种损失方案均旨在鼓励TSE网络基于所述分布信息关注那些SC块。在此基础上,我们提出X-SepFormer,一种具有所提损失方案且以SepFormer为骨干的端到端TSE模型。在基准WSJ0-2mix数据集上的实验结果验证了我们方法的有效性,显示SC错误持续降低(相对降低14.8%)。此外,凭借19.4 dB的SI-SDRi和3.81的PESQ,我们的最佳系统显著优于当前SOTA系统,并提供了迄今在WSJ0-2mix上报道的最优TSE结果。

关键词

引用

@article{arxiv.2303.05023,
  title  = {X-SepFormer: End-to-end Speaker Extraction Network with Explicit Optimization on Speaker Confusion},
  author = {Kai Liu and Ziqing Du and Xucheng Wan and Huan Zhou},
  journal= {arXiv preprint arXiv:2303.05023},
  year   = {2023}
}

备注

Accepted by ICASSP 2023