关于说话人表征学习中自监督蒸馏方法的综合研究
声音
2022-11-28 v2 音频与语音处理
摘要
在实际应用场景中,由于说话人隐私问题,往往难以获取大量标注数据用于说话人表征学习。无标签的自监督学习已成为解决该问题日益可行的方式。与对比学习相比,自蒸馏方法在损失函数中仅使用正样本,因而更具吸引力。本文对自蒸馏自监督说话人表征学习,尤其是关键的数据增强,进行了综合研究。我们提出的音频扰动增强策略将说话人表征的性能推向了新的极限。实验结果表明,我们的模型在Voxceleb1说话人验证评测基准上取得了新的SOTA(即对于Vox1-O、Vox1-E和Vox1-H测试集,等错误率(EER)分别为2.505%、2.473%和4.791%),且在训练阶段未使用任何说话人标签。
引用
@article{arxiv.2210.15936,
title = {A comprehensive study on self-supervised distillation for speaker representation learning},
author = {Zhengyang Chen and Yao Qian and Bing Han and Yanmin Qian and Michael Zeng},
journal= {arXiv preprint arXiv:2210.15936},
year = {2022}
}
备注
Accepted by SLT2022