用于自监督说话人验证的课程学习
音频与语音处理
2024-02-15 v4
摘要
本文的目标是在没有身份标签的情况下训练有效的自监督说话人表示。我们在自监督学习框架内提出了两种课程学习策略。第一种策略旨在通过扩大训练数据集的使用比例,在训练阶段逐步增加说话人的数量。第二种策略随着训练的进行,对小批量内的更多话语应用各种数据增强。使用 DINO 自监督框架在 VoxCeleb1 评估协议上进行的一系列实验证明了我们提出的课程学习策略的有效性。我们报告了在单阶段训练下 4.47% 的具有竞争力的等错误率,并证明了通过在小型有标签数据集上进行微调,性能可进一步提升至 1.84%。
引用
@article{arxiv.2203.14525,
title = {Curriculum learning for self-supervised speaker verification},
author = {Hee-Soo Heo and Jee-weon Jung and Jingu Kang and Youngki Kwon and You Jin Kim and Bong-Jin Lee and Joon Son Chung},
journal= {arXiv preprint arXiv:2203.14525},
year = {2024}
}
备注
INTERSPEECH 2023. 5 pages, 3 figures, 4 tables