基于生成对抗网络隐空间聚类的说话人日记化
音频与语音处理
2019-10-28 v1 声音
摘要
在这项工作中,我们提出利用生成对抗网络(GAN)反投影结合编码器网络进行深度隐空间聚类以实现说话人日记化。所提出的日记化系统与GAN损失、隐变量恢复损失和聚类特定损失联合训练。它在输入处使用x-vector说话人嵌入,而隐变量从连续随机变量与利用原始说话人标签的离散独热编码变量的组合中采样。我们在AMI会议语料库以及来自自闭症诊断领域的两个儿童-临床医生交互语料库(ADOS和BOSCC)上基准测试了我们提出的系统。ADOS和BOSCC分别包含在临床环境中获得的言语儿童及青少年自闭症的诊断和治疗结果会话。实验结果表明,我们提出的系统在这些数据库上显著优于最先进的基于x-vector的日记化系统。此外,我们通过与x-vectors进行嵌入融合,在使用 oracle 语音分段的x-vector基线相比时,在AMI eval、ADOS和BOSCC语料库上分别实现了31%、36%和49%的相对DER提升。
引用
@article{arxiv.1910.11398,
title = {Speaker diarization using latent space clustering in generative adversarial network},
author = {Monisankha Pal and Manoj Kumar and Raghuveer Peri and Tae Jin Park and So Hyun Kim and Catherine Lord and Somer Bishop and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:1910.11398},
year = {2019}
}
备注
Submitted to ICASSP 2020