中文

会议场景下面向多目标说话人的同步语音提取

音频与语音处理 2023-11-21 v2 声音

摘要

常见的目标语音分离直接估计目标源,忽略了各帧中不同说话人之间的相互关系。我们提出一种多目标语音分离模型(MTSS),用于从混合语音中同步提取每位说话人的声音,而非仅最优估计目标源。此外,我们提出一种说话人日记化(SD)感知的 MTSS 系统(SD-MTSS),其由 SD 模块与 MTSS 模块组成。通过利用 TSVAD 决策与估计掩码,我们的 SD-MTSS 模型可在对话录音中同时提取每位说话人的语音信号,而无需事先额外的注册音频。实验结果表明,在 WSJ0-2mix-extr 数据集上,我们的 MTSS 模型相较基线分别实现了 1.38dB SDR、1.34dB SI-SDR 与 0.13 PESQ 的提升。SD-MTSS 系统在 Alimeeting 数据集上取得了 19.2% 的相对说话人相关字符错误率(CER)降低。

关键词

引用

@article{arxiv.2206.08525,
  title  = {Simultaneous Speech Extraction for Multiple Target Speakers under the Meeting Scenarios},
  author = {Bang Zeng and Hongbing Suo and Yulong Wan and Ming Li},
  journal= {arXiv preprint arXiv:2206.08525},
  year   = {2023}
}

备注

13 pages, 3 figures, Accepted by NCMMSC2023