通过变分信息瓶颈挑战基于边缘的说话人嵌入提取器
音频与语音处理
2024-06-19 v1
摘要
说话人嵌入提取器通常使用对训练说话人的分类损失进行训练。近年来,标准的softmax/交叉熵损失已被边缘基准损失取代,显著提升了说话人识别准确率。动机在于边缘仅在训练期间降低目标说话人的logit,我们考虑一种类似效果的概率框架。变分信息瓶颈提供了一种原则化的机制,使确定性节点变为随机,从而在隐式上降低目标说话人的后验概率。我们在广泛的说话人识别基准和评分方法上进行实验,并报告了与最先进的Additive Angular Margin损失相当的成绩。
引用
@article{arxiv.2406.12622,
title = {Challenging margin-based speaker embedding extractors by using the variational information bottleneck},
author = {Themos Stafylakis and Anna Silnova and Johan Rohdin and Oldrich Plchot and Lukas Burget},
journal= {arXiv preprint arXiv:2406.12622},
year = {2024}
}
备注
Accepted at Interspeech 2024