中文

VoxBlink:一种大规模摄像头说话人确认数据集

音频与语音处理 2023-12-14 v7 多媒体 声音

摘要

本文介绍一种大规模高质量音视频说话人确认数据集,名为VoxBlink。我们提出一种创新且鲁棒的音视频数据自动挖掘流程来构建该数据集,其包含来自38K说话人的1.45M条语音。由于自动数据收集的内在特性,引入噪声数据不可避免。因此,我们还利用多模态净化步骤生成更干净的VoxBlink版本,名为VoxBlink-clean,包含18K个身份与1.02M条语音。与VoxCeleb不同,VoxBlink来源于普通用户的短视频,所覆盖场景能更好地贴合真实生活情形。据我们所知,VoxBlink数据集是公开可用的最大说话人确认数据集之一。结合VoxCeleb与VoxBlink-clean数据集,我们采用具有多种架构骨干的多样化说话人确认模型,在VoxCeleb测试集上进行综合评估。实验结果表明,在训练过程中加入VoxBlink-clean后,各骨干架构的性能相对提升达12%至30%。数据集详情见http://voxblink.github.io。

关键词

引用

@article{arxiv.2308.07056,
  title  = {VoxBlink: A Large Scale Speaker Verification Dataset on Camera},
  author = {Yuke Lin and Xiaoyi Qin and Guoqing Zhao and Ming Cheng and Ning Jiang and Haiyang Wu and Ming Li},
  journal= {arXiv preprint arXiv:2308.07056},
  year   = {2023}
}

备注

Accepted By ICASSP2024