中文

用于半监督说话人判别声学嵌入的余弦距离虚拟对抗训练

音频与语音处理 2020-08-11 v1 声音

摘要

本文提出一种半监督学习(SSL)技术,用于训练深度神经网络(DNNs)以生成说话人判别声学嵌入(说话人嵌入)。在期望的目标领域获取大量说话人识别训练数据可能较为困难,尤其在隐私约束下。所提技术通过利用无标签数据降低对标签数据的需求。该技术是虚拟对抗训练(VAT)[1]的一种变体,其损失形式定义为说话人嵌入对输入扰动的鲁棒性,由余弦距离度量。因此,我们称该技术为余弦距离虚拟对抗训练(CD-VAT)。与许多现有 SSL 技术相比,无标签数据不必来自与标签数据相同的类别集合(此处为说话人)。CD-VAT 的有效性在 2750+ 小时的 VoxCeleb 数据集上得到展示,在说话人验证任务中,其等错误率(EER)相较纯监督基线相对降低 11.1%。这相当于若无标签数据的说话人标签可用时,监督训练所能带来改进的 32.5%。

关键词

引用

@article{arxiv.2008.03756,
  title  = {Cosine-Distance Virtual Adversarial Training for Semi-Supervised Speaker-Discriminative Acoustic Embeddings},
  author = {Florian L. Kreyssig and Philip C. Woodland},
  journal= {arXiv preprint arXiv:2008.03756},
  year   = {2020}
}

备注

Accepted to Interspeech 2020