中文

VoxCeleb2:深度说话人识别

声音 2020-11-05 v2 计算机视觉与模式识别 音频与语音处理

摘要

本文的目标是在噪声和非受限条件下进行说话人识别。我们做出了两项关键贡献。首先,我们引入了一个从开源媒体收集的非常大规模的音视觉说话人识别数据集。通过使用全自动化流程,我们整理了 VoxCeleb2,其包含来自 6000 多名说话人的超过一百万条语音。这比任何公开可用的说话人识别数据集都要大数倍。其次,我们开发并比较了能够有效在各种条件下从声音中识别身份的卷积神经网络(CNN)模型和训练策略。在 VoxCeleb2 数据集上训练的模型在基准数据集上的性能显著超越先前的工作。

关键词

引用

@article{arxiv.1806.05622,
  title  = {VoxCeleb2: Deep Speaker Recognition},
  author = {Joon Son Chung and Arsha Nagrani and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1806.05622},
  year   = {2020}
}

备注

To appear in Interspeech 2018. The audio-visual dataset can be downloaded from http://www.robots.ox.ac.uk/~vgg/data/voxceleb2 . 1806.05622v2: minor fixes; 5 pages