探索用于说话人验证的二分类损失
音频与语音处理
2023-07-18 v1 声音
摘要
闭集训练与开集测试之间的不匹配通常会导致说话人验证任务性能显著下降。对于现有损失函数,基于度量学习的目标严重依赖寻找有效样本对,这可能阻碍进一步提升。而流行的多分类方法在未见说话人上评估时通常出现性能退化。本工作中,我们引入 SphereFace2 框架,其使用若干二分类器以成对方式训练说话人模型,而非进行多分类。得益于该学习范式,它能有效缓解训练与评估间的鸿沟。在 Voxceleb 上的实验表明,SphereFace2 优于其他现有损失函数,尤其在困难试对(hard trials)上。此外,大间隔微调(large margin fine-tuning)策略被证明与其兼容以进一步提升性能。最后,SphereFace2 还展现出对类级噪声标签的强鲁棒性,有潜力应用于具有不准确估计伪标签的半监督训练场景。代码见 https://github.com/Hunterhuan/sphereface2_speaker_verification
引用
@article{arxiv.2307.08205,
title = {Exploring Binary Classification Loss For Speaker Verification},
author = {Bing Han and Zhengyang Chen and Yanmin Qian},
journal= {arXiv preprint arXiv:2307.08205},
year = {2023}
}
备注
Accepted by ICASSP 2023