VoxCeleb 说话人识别挑战回顾
声音
2024-08-28 v1 人工智能
音频与语音处理
摘要
VoxCeleb 说话人识别挑战(VoxSRC)是一系列自2019年至2023年每年举办的挑战和研讨会。这些挑战主要评估了在不同设置下的说话人识别和说话人聚类任务,包括封闭式和开放式训练数据;以及监督式、自监督式和半监督式训练下的领域适应。挑战还为每个任务和设置提供了可公开获取的训练和评估数据集,并每年发布新的测试集。在本文中,我们提供了这些挑战的回顾,涵盖:它们探索了什么内容;挑战参赛者所develop的方法及其演变;以及说话人验证和说话人聚类当前领域的现状。我们绘制了在共同评估数据集上五届挑战性能进展,并详细分析了每年的特殊关注点如何影响参赛者的性能。本文旨面向希望获得说话人识别和说话人聚类领域概览的研究人员,也面向希望从 VoxSRC 挑战的成功与错误中获益的挑战组织者。我们以讨论该领域当前的优势和开放性挑战作结尾。项目页面:https://mm.kaist.ac.kr/datasets/voxceleb/voxsrc/workshop.html
引用
@article{arxiv.2408.14886,
title = {The VoxCeleb Speaker Recognition Challenge: A Retrospective},
author = {Jaesung Huh and Joon Son Chung and Arsha Nagrani and Andrew Brown and Jee-weon Jung and Daniel Garcia-Romero and Andrew Zisserman},
journal= {arXiv preprint arXiv:2408.14886},
year = {2024}
}
备注
TASLP 2024