利用自预训练 Transformer 模型改进说话人验证
音频与语音处理
2023-05-19 v1
摘要
近年来,利用下游数据集微调大型预训练 Transformer 模型引起了日益增长的兴趣。尽管取得了成功,但从预训练的局限性中分离大规模数据集和 Transformer 结构的益处仍然具有挑战性。在本文中,我们引入了一种称为自预训练的分层训练方法,其中 Transformer 模型在同一数据集上进行了预训练和微调。包括 HuBERT、Conformer 和 WavLM 在内的三个预训练模型在四个不同大小的说话人验证数据集上进行了评估。我们的实验表明,这些自预训练模型在下游说话人验证任务上取得了具有竞争力的性能,仅使用 Librispeech 预训练三分之一的数据,例如 VoxCeleb1 和 CNCeleb1。此外,当仅在 VoxCeleb2-dev 上预训练时,在相同微调设置下,Conformer 模型优于在 94k 小时数据上预训练的模型。
引用
@article{arxiv.2305.10517,
title = {Improving Speaker Verification with Self-Pretrained Transformer Models},
author = {Junyi Peng and Oldřich Plchot and Themos Stafylakis and Ladislav Mošner and Lukáš Burget and Jan Černocký},
journal= {arXiv preprint arXiv:2305.10517},
year = {2023}
}
备注
Accepted to Interspeech 2023