面向域不变说话人验证与防欺骗的贝叶斯学习
音频与语音处理
2025-06-10 v1
摘要
在实际场景中,自动说话人验证(ASV)和防欺骗性能会因域不匹配条件而显著下降。基于特征在时和通道轴上沿时间轴的统计信息进行归一化的松弛实例频率归一化(RFN),是一种有前景的降低说话人嵌入网络特征图域依赖性的方法。我们主张不同频率应获得不同的权重,并且应考虑由于域迁移导致的权重不确定性。为此,我们提出利用变分推断建模权重的后验分布,从而实现贝叶斯加权RFN(BWRFN)。该方法克服了固定权重RFN的局限性,在域不匹配条件下更为有效。在跨数据集ASV、跨TTS防欺骗和防欺骗鲁棒的ASV上进行的大量实验表明,BWRFN在WBRFN和RFN方面具有显著优势。
引用
@article{arxiv.2506.07536,
title = {Bayesian Learning for Domain-Invariant Speaker Verification and Anti-Spoofing},
author = {Jin Li and Man-Wai Mak and Johan Rohdin and Kong Aik Lee and Hynek Hermansky},
journal= {arXiv preprint arXiv:2506.07536},
year = {2025}
}
备注
Accepted to Interspeech2025