用于自监督说话人识别的增广对抗训练
声音
2020-11-02 v3 机器学习
音频与语音处理
摘要
本工作的目标是在无说话人标签的情况下训练鲁棒的说话人识别模型。近期关于无监督说话人表示的工作基于对比学习,鼓励句内嵌入相似而句间嵌入相异。然而,由于句内片段共享相同的声学特征,难以将说话人信息从信道信息中分离。为此,我们提出增广对抗训练策略,训练网络对说话人信息具有判别性,同时对所施加的增广保持不变性。由于增广模拟了声学特征,训练网络对增广不变也鼓励网络一般地对信道信息不变。在 VoxCeleb 和 VOiCES 数据集上的大量实验表明,相较先前使用自监督的工作有显著提升,且我们的自监督模型性能远超人类。
引用
@article{arxiv.2007.12085,
title = {Augmentation adversarial training for self-supervised speaker recognition},
author = {Jaesung Huh and Hee Soo Heo and Jingu Kang and Shinji Watanabe and Joon Son Chung},
journal= {arXiv preprint arXiv:2007.12085},
year = {2020}
}
备注
Workshop on Self-Supervised Learning for Speech and Audio Processing, NeurIPS