泛化说话人验证以实现嵌入空间中的欺骗感知
密码学与安全
2024-01-30 v2 人工智能
声音
音频与语音处理
摘要
众所周知,自动说话人验证(ASV)系统可被多种类型的攻击者所欺骗。对抗此类攻击以保护 ASV 系统的常用方法是开发一个独立的欺骗反制(CM)模块,将语音输入分类为真实语音或欺骗语音。然而,这种设计在认证阶段需要额外的计算与利用开销。另一种策略是设计一个单一的 ASV 系统来同时处理零努力冒充者(非目标)和欺骗攻击。这种具有欺骗感知能力的 ASV 系统有潜力提供更强的保护且计算更经济。为此,我们提出将独立的 ASV(G-SASV)泛化以抵御欺骗攻击,其中我们利用有限的 CM 训练数据在嵌入空间中增强一个简单的后端,而在测试(认证)阶段无需独立的 CM 模块参与。我们提出了一种新颖且简单的基于深度神经网络的后端分类器,并在训练阶段通过欺骗嵌入的领域适应和多任务集成进行了研究。实验在 ASVspoof 2019 逻辑访问数据集上进行,在联合(真实与欺骗)和欺骗条件下,我们以等错误率衡量,将统计 ASV 后端的性能分别最多提升了 36.2% 和 49.8%。
引用
@article{arxiv.2401.11156,
title = {Generalizing Speaker Verification for Spoof Awareness in the Embedding Space},
author = {Xuechen Liu and Md Sahidullah and Kong Aik Lee and Tomi Kinnunen},
journal= {arXiv preprint arXiv:2401.11156},
year = {2024}
}
备注
Published in IEEE/ACM Transactions on Audio, Speech, and Language Processing (doi updated)