中文

自监督说话人嵌入

计算机视觉与模式识别 2019-04-24 v2

摘要

与 i-vectors 不同,诸如 x-vectors 之类的说话人嵌入由于针对训练说话人的分类损失,无法利用未标注语音。本文中,我们探索一种替代训练策略,以在训练中启用未标注语音的使用。我们提出通过重构目标语音段的帧来训练说话人嵌入提取器,给定同一话语另一语音段推断出的嵌入。为此,我们在标准说话人嵌入提取器上附加一个解码器网络,我们不仅向该解码器输入说话人嵌入,还输入目标帧序列的估计音素(phone)序列。重构损失既可作为单一目标使用,也可与标准说话人分类损失结合。在后一种情况下,它充当正则化器,鼓励对训练期间未见过说话人的泛化能力。在所有情况下,所提架构均从头开始并以端到端方式训练。我们在 VoxCeleb 与 Speakers in the wild 上展示了所提方法的益处,并报告了相对于基线的显著提升。

关键词

引用

@article{arxiv.1904.03486,
  title  = {Self-supervised speaker embeddings},
  author = {Themos Stafylakis and Johan Rohdin and Oldrich Plchot and Petr Mizera and Lukas Burget},
  journal= {arXiv preprint arXiv:1904.03486},
  year   = {2019}
}

备注

Preprint. Submitted to Interspeech 2019. Updated results compared to first version and minor corrections