基于多模型融合应对欺骗感知的说话人验证
声音
2022-06-22 v1 机器学习
音频与语音处理
摘要
近年来,自动说话人验证(ASV)取得了非凡的发展。然而,先前的研究表明,最先进的ASV模型极易受到语音欺骗攻击,而最近提出的高性能欺骗对策(CM)模型仅专注于独立的抗欺骗任务,忽略了后续的说话人验证过程。如何将CM与ASV集成在一起仍是一个悬而未决的问题。最近举办了一项欺骗感知的说话人验证(SASV)挑战赛,其论点是当CM和ASV子系统联合优化时,可以实现更好的性能。在该挑战赛的场景下,要求参赛者提出的集成系统既能拒绝冒充说话人,也能拒绝来自目标说话人的欺骗攻击,这直观且有效地匹配了对一个可靠、抗欺骗的ASV系统的期望。本工作专注于基于融合的SASV解决方案,并提出了一种多模型融合框架,以利用多个最先进的ASV和CM模型的强大能力。所提出的框架将SASV等错误率(EER)从8.75%大幅降低至1.17%,与SASV挑战赛中的最佳基线系统相比,相对提升了86%。
引用
@article{arxiv.2206.09131,
title = {Tackling Spoofing-Aware Speaker Verification with Multi-Model Fusion},
author = {Haibin Wu and Jiawen Kang and Lingwei Meng and Yang Zhang and Xixin Wu and Zhiyong Wu and Hung-yi Lee and Helen Meng},
journal= {arXiv preprint arXiv:2206.09131},
year = {2022}
}
备注
Accepted by Odyssey 2022