自监督说话人嵌入
计算机视觉与模式识别
2019-04-24 v2
摘要
与 i-vectors 不同,诸如 x-vectors 之类的说话人嵌入由于针对训练说话人的分类损失,无法利用未标注语音。本文中,我们探索一种替代训练策略,以在训练中启用未标注语音的使用。我们提出通过重构目标语音段的帧来训练说话人嵌入提取器,给定同一话语另一语音段推断出的嵌入。为此,我们在标准说话人嵌入提取器上附加一个解码器网络,我们不仅向该解码器输入说话人嵌入,还输入目标帧序列的估计音素(phone)序列。重构损失既可作为单一目标使用,也可与标准说话人分类损失结合。在后一种情况下,它充当正则化器,鼓励对训练期间未见过说话人的泛化能力。在所有情况下,所提架构均从头开始并以端到端方式训练。我们在 VoxCeleb 与 Speakers in the wild 上展示了所提方法的益处,并报告了相对于基线的显著提升。
引用
@article{arxiv.1904.03486,
title = {Self-supervised speaker embeddings},
author = {Themos Stafylakis and Johan Rohdin and Oldrich Plchot and Petr Mizera and Lukas Burget},
journal= {arXiv preprint arXiv:1904.03486},
year = {2019}
}
备注
Preprint. Submitted to Interspeech 2019. Updated results compared to first version and minor corrections