中文

基于选择性听觉注意的单说话人与多说话人语音目标说话人验证

音频与语音处理 2021-04-05 v2 人机交互 声音

摘要

说话人验证大多在单说话人条件下进行研究。其在干扰说话人存在时受到不利影响。受目标说话人提取(如 SpEx)研究的启发,我们提出了一种面向单说话人与多说话人语音的统一说话人验证框架,能够对目标说话人施加选择性听觉注意。该目标说话人验证(tSV)框架通过多任务学习联合优化说话人注意力模块与说话人表征模块。我们在 tSV 框架下研究了四种不同的目标说话人嵌入方案。实验结果表明,所有四种目标说话人嵌入方案在多说话人语音上均显著优于其它竞争性方案。值得注意的是,在 2 说话人语音上,最佳的 tSV 说话人嵌入方案在 WSJ0-2mix-extr 和 Libri2Mix 语料库上相对于基线系统在等错误率方面分别实现了 76.0% 和 55.3% 的相对提升,而 tSV 在单说话人语音上的性能与传统说话人验证系统相当,后者在相同的单说话人条件下训练和评估。

关键词

引用

@article{arxiv.2103.16269,
  title  = {Target Speaker Verification with Selective Auditory Attention for Single and Multi-talker Speech},
  author = {Chenglin Xu and Wei Rao and Jibin Wu and Haizhou Li},
  journal= {arXiv preprint arXiv:2103.16269},
  year   = {2021}
}

备注

13 pages, submitted to IEEE/ACM transaction on Audio, Speech and Language on 10 Jan. 2021