微调 wav2vec2 用于说话人识别
声音
2022-05-09 v2 机器学习
音频与语音处理
摘要
本文探讨将 wav2vec2 框架应用于说话人识别而非语音识别。我们研究了预训练权重在说话人识别任务上的有效性,以及如何将 wav2vec2 输出序列池化为固定长度的说话人嵌入。为使该框架适应说话人识别,我们提出了一种使用 CE 或 AAM softmax 损失的单话语分类变体,以及一种使用 BCE 损失的话语对分类变体。我们性能最佳的变体 w2v2-aam 在扩展的 voxceleb1 测试集上取得了 1.88% 的 EER,而 ECAPA-TDNN 基线为 1.69% 的 EER。代码可在 https://github.com/nikvaessen/w2v2-speaker 获取。
引用
@article{arxiv.2109.15053,
title = {Fine-tuning wav2vec2 for speaker recognition},
author = {Nik Vaessen and David A. van Leeuwen},
journal= {arXiv preprint arXiv:2109.15053},
year = {2022}
}
备注
accepted to ICASSP 2022