JHU 提交至 VoxSRC-21 的系统:Track 3
音频与语音处理
2021-09-29 v1 机器学习
声音
摘要
本技术报告描述了约翰斯·霍普金斯大学提交至 Voxceleb 说话人识别挑战赛 2021 Track 3:自监督说话人验证(闭集)的说话人识别系统。我们的整体训练流程类似于去年 VoxSRC2020 挑战赛第一名团队所提出的方法。主要区别在于,计算机视觉(CV)中近期提出的非对比自监督方法——无标签蒸馏(DINO)被用于训练我们的初始模型,其性能优于去年基于动量对比(MoCo)的对比学习。此外,这在迭代聚类阶段仅需少量迭代,其中用于监督嵌入学习的伪标签根据持续迭代微调的模型所生成嵌入的聚类结果进行更新。在最后阶段,Res2Net50 在迭代聚类阶段得到的最终伪标签上进行训练。这是我们提交给挑战赛的最佳模型,在 voxceleb1 测试集 o、VoxSRC-21 验证集和测试集上的等错误率(EER,%)分别为 1.89、6.50 和 6.89。
引用
@article{arxiv.2109.13425,
title = {The JHU submission to VoxSRC-21: Track 3},
author = {Jejin Cho and Jesus Villalba and Najim Dehak},
journal= {arXiv preprint arXiv:2109.13425},
year = {2021}
}