VoxBlink2:一个 10 万+ 说话人识别语料库与开放式说话人识别基准
音频与语音处理
2024-07-17 v1
摘要
本文提供了一个大型音视频说话人识别数据集 VoxBlink2,包含约 1000 万段语料,来自 11 万多位说话人的野外视频。该数据集在 VoxBlink 数据集的基础上显著扩大,因优化的数据收集管道而包含更广泛的说话人和情景多样性。随后,我们探讨了训练策略、数据规模和模型复杂度对说话人验证的影响,并最终在 VoxCeleb1-O 测试集上建立了新的单模型 SOTA EER 为 0.170% 和 minDCF 为 0.006%。如此卓越的结果促使我们从全新的挑战性视角探索说话人识别。我们提出开放式说话人识别任务,旨在将探测语料与已知画廊说话人匹配,或将其分类为未知查询。与此任务相关,我们设计了具体的基准和评估协议。数据和模型资源可在 http://voxblink2.github.io 找到。
引用
@article{arxiv.2407.11510,
title = {VoxBlink2: A 100K+ Speaker Recognition Corpus and the Open-Set Speaker-Identification Benchmark},
author = {Yuke Lin and Ming Cheng and Fulin Zhang and Yingying Gao and Shilei Zhang and Ming Li},
journal= {arXiv preprint arXiv:2407.11510},
year = {2024}
}
备注
Accepted By InterSpeech2024