中文

基于生成对抗网络中潜空间聚类的元学习说话人日志方法

音频与语音处理 2020-07-21 v1 声音

摘要

大多数使用 x-vector 嵌入的说话人日志系统的性能既易受噪声环境影响,也缺乏领域鲁棒性。早期利用带编码器网络(ClusterGAN)的生成对抗网络(GAN)将输入 x-vector 投影到潜空间以进行说话人日志的研究,在会议数据上展现出良好前景。本文扩展 ClusterGAN 网络,以提升日志鲁棒性并实现跨多种挑战性领域的快速泛化。为此,我们在元学习范式下提取 ClusterGAN 的预训练编码器,并使用原型损失(元 ClusterGAN 或 MCGAN)对其进行微调。实验在 CALLHOME 电话对话、AMI 会议数据、包含挑战性多领域语料的 DIHARD II(开发集),以及与自闭症谱系障碍领域相关的两个儿童-临床医生交互语料(ADOS、BOSCC)上进行。我们对实验数据进行了广泛分析,以探究所提 ClusterGAN 与 MCGAN 嵌入相对于 x-vector 的有效性。结果表明,所提嵌入配合归一化最大特征间隙谱聚类(NME-SC)后端,始终优于 Kaldi 最先进的 z-vector 日志系统。最后,我们采用与 x-vector 的嵌入融合以进一步提升日志性能。相较于 x-vector,我们使用所提融合嵌入在上述数据集上实现了 6.67% 至 53.93% 的相对日志错误率(DER)提升。此外,在电话数据中,与 x-vector 和 ClusterGAN 相比,MCGAN 嵌入在说话人数量估计与短语音段日志方面表现更优。

关键词

引用

@article{arxiv.2007.09635,
  title  = {Meta-learning with Latent Space Clustering in Generative Adversarial Network for Speaker Diarization},
  author = {Monisankha Pal and Manoj Kumar and Raghuveer Peri and Tae Jin Park and So Hyun Kim and Catherine Lord and Somer Bishop and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2007.09635},
  year   = {2020}
}

备注

Submitted to IEEE/ACM TRANSACTIONS ON AUDIO SPEECH AND LANGUAGE PROCESSING