EACELEB:用于说话人识别的东亚语言说话名人数据集
声音
2022-03-11 v1 音频与语音处理
摘要
大型数据集对训练说话人识别系统非常有用,多年来各研究组已构建了若干此类数据集。Voxceleb 是一个从 Youtube 视频中提取的用于说话人识别的大型数据集。本文提出一种以说话人姓名为输入、从 Youtube 获取音频数据的音视频方法。该系统遵循与 Voxceleb 数据采集方法类似的流程。然而,我们的工作侧重于通过一旦检测到人脸即在后续帧中使用人脸跟踪来实现快速数据采集——考虑到计算成本,这优于逐帧人脸检测。我们表明,在获取数据后对其施加音频日记化(diarization)可得到与 Voxceleb 相当的等错误率。一组补充实验表明,通过使用所获取的数据微调预训练的 x-vector 系统,可进一步降低错误率。与 Voxceleb 类似,此处工作主要关注为名人开发音频。但不同于 Voxceleb,我们的目标音频数据来自东亚国家的名人。最后,我们建立了一个说话人验证任务来评估所获取数据的准确性。经过日记化与微调,我们在整个数据集上取得了约 4% 的等错误率。
引用
@article{arxiv.2203.05333,
title = {EACELEB: An East Asian Language Speaking Celebrity Dataset for Speaker Recognition},
author = {Desmond Caulley and Yufeng Yang and David Anderson},
journal= {arXiv preprint arXiv:2203.05333},
year = {2022}
}