基于时域嵌入的串联抗欺骗自动说话人验证
音频与语音处理
2024-12-24 v1
摘要
抗欺骗自动说话人验证(SASV)系统是保护免受伪造语音攻击的关键技术。本研究聚焦于逻辑访问攻击,提出一种新颖的SASV方法。采用基于语音�幅在时域中概率质量函数(PMF)的表示方法来表示真实语音和伪造语音。该方法生成基于训练集中所选组的PMF派生出的新时域嵌入。本文强调了性别分离的作用及其积极影响。我们提出的反措施(CM)系统采用基于PMF的伪造语音和真实语音时域嵌入,以及基于男性和女性时域嵌入的性别识别。该方法在性别识别方面表现突出,男性和女性的错位率分别为0.94%和1.79%。男性和女性CM系统的均衡错误率(EER)分别为8.67%和10.12%。通过将该方法与传统说话人验证系统集成,我们在ASVspoof2019挑战数据库上展示了更好的泛化能力和串联检测成本评估。此外,我们研究了将时域嵌入方法与传统CM方法融合的影响,说明了这种融合如何增强SASV架构的泛化能力。
引用
@article{arxiv.2412.17133,
title = {Tandem spoofing-robust automatic speaker verification based on time-domain embeddings},
author = {Avishai Weizman and Yehuda Ben-Shimol and Itshak Lapidot},
journal= {arXiv preprint arXiv:2412.17133},
year = {2024}
}
备注
11 pages, 8 figures