以有限数据训练说话人识别系统
声音
2023-02-28 v2 机器学习
音频与语音处理
摘要
本工作考虑以远小于当代工作的数据集规模训练用于说话人识别的神经网络。我们通过提出流行 VoxCeleb2 数据集的三个子集来人为限制数据量。这些子集被限制为 50 k 音频文件(对比可用的超过 1 M 文件),并在说话人数量与会话可变性轴上有所不同。我们在这些子集上训练了三种说话人识别系统:X-vector、ECAPA-TDNN 与 wav2vec2 网络架构。我们展示了当训练数据有限时,wav2vec2 的自监督预训练权重大幅改善性能。代码与数据子集见 https://github.com/nikvaessen/w2v2-speaker-few-samples。
引用
@article{arxiv.2203.14688,
title = {Training speaker recognition systems with limited data},
author = {Nik Vaessen and David A. van Leeuwen},
journal= {arXiv preprint arXiv:2203.14688},
year = {2023}
}
备注
accepted to Interspeech 2022