中文

基于无监督对抗不变性的鲁棒说话人识别

音频与语音处理 2019-11-05 v1 声音 信号处理

摘要

本文中,我们针对挑战性声学条件下的说话人识别问题,提出一种提取鲁棒说话人判别语音表示的新方法。我们采用近期提出的无监督对抗不变性架构来训练一个网络,将使用预训练模型提取的说话人嵌入映射到两个低维嵌入空间。这些嵌入空间被学习为将说话人判别信息从音频记录中存在的所有其他信息中解耦,而无需关于声学条件的监督。我们在一个大规模说话人识别语料库上,针对说话人验证与无监督聚类任务中信号存在的各类变异源,分析了所提嵌入的鲁棒性。我们的分析表明,所提系统在多种挑战性声学场景下大幅优于基线。此外,在真实会议语料上的说话人日志化任务中,我们的系统相较最先进基线取得了36%的日志化错误率相对提升。

关键词

引用

@article{arxiv.1911.00940,
  title  = {Robust speaker recognition using unsupervised adversarial invariance},
  author = {Raghuveer Peri and Monisankha Pal and Arindam Jati and Krishna Somandepalli and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:1911.00940},
  year   = {2019}
}

备注

Submitted to ICASSP 2020