压榨跨域标签价值:一种用于说话人确认的解耦打分方法
声音
2020-10-28 v1 机器学习
音频与语音处理
摘要
域失配在实际应用中频繁发生,并导致说话人确认系统性能严重下降。通常的做法是收集跨域数据并训练一个多域 PLDA 模型,期望学习到与域无关的说话人子空间。本文中,我们首先给出一项实证研究,表明在注册-测试失配的条件下,简单地添加跨域数据无助于性能。仔细分析表明,这一惊人结果是由注册与测试条件间不一致的统计量所致。基于该分析,我们提出一种解耦打分方法,可在注册与测试失配时最大程度压榨跨域标签的价值并获得最优确认分数。当统计量一致时,新公式退化为常规 PLDA。跨信道测试上的实验结果表明,所提方法极为有效,是域失配的原则性解决方案。
引用
@article{arxiv.2010.14243,
title = {Squeezing value of cross-domain labels: a decoupled scoring approach for speaker verification},
author = {Lantian Li and Yang Zhang and Jiawen Kang and Thomas Fang Zheng and Dong Wang},
journal= {arXiv preprint arXiv:2010.14243},
year = {2020}
}
备注
Submitted to ICASSP 2021