IDLAB 的 VoxSRC-20 参赛方案:基于 DNN 说话人确认中的大间隔微调与质量感知分数校准
声音
2021-06-29 v2 音频与语音处理
摘要
本文提出并分析了文本无关说话人确认中的一种大间隔微调策略与一种质量感知分数校准方法。大间隔微调是针对以基于间隔的损失函数训练的 DNN 说话人确认系统的第二阶段训练,它通过允许使用更长的训练语音片段并结合更具攻击性的间隔惩罚,使网络能够生成更具鲁棒性的说话人嵌入。分数校准是说话人确认系统中的常见做法,用于将输出分数映射为校准良好的对数似然比,并可转换为可解释的概率。通过在校准系统中引入质量特征,评估指标的决策阈值变得依赖于质量,并在不同试验条件下更为一致。在 ECAPA-TDNN 架构上应用上述两种增强手段,可在所有公开可用的 VoxCeleb1 测试集上取得最先进结果,并助力我们在 VoxCeleb 说话人识别挑战赛 2020 的监督确认赛道中获胜。
引用
@article{arxiv.2010.11255,
title = {The IDLAB VoxSRC-20 Submission: Large Margin Fine-Tuning and Quality-Aware Score Calibration in DNN Based Speaker Verification},
author = {Jenthe Thienpondt and Brecht Desplanques and Kris Demuynck},
journal= {arXiv preprint arXiv:2010.11255},
year = {2021}
}
备注
proceedings of ICASSP 2021