面向物联网智能设备的平行堆叠聚合网络语音认证
声音
2024-12-02 v1 密码学与安全
神经与进化计算
音频与语音处理
摘要
语音认证在物联网智能设备上日益受到重视,因用户隐私和安全性日益增强而备受关注。当前认证系统易受不同语音欺骗攻击(如回放、语音克隆和音频深度伪造)的威胁,这些攻击模仿合法语音以欺骗认证系统,进而导致欺诈行为(如冒充、未授权访问、金融诈骗等)。现有解决方案常针对单一类型攻击进行设计,导致对未见攻击时性能受损。另一方面,面向物联网的现有统一语音防欺骗解决方案架构复杂,难以部署在物联网智能设备上。此外,这些统一解决方案表现出显著的性能问题,包括更高的等效错误率或特定攻击的较低准确率。为克服这些问题,我们提出了平行堆叠聚合网络(PSA-Net),一个为语音控制智能物联网设备设计的轻量级框架,作为防欺骗防御系统。PSA-Net直接处理原始音频,无需依赖数据集相关的手工特征或预计算的频谱图。此外,PSA-Net采用分段-变换-聚合方法,包括语音切分、通过卷积提取内在可微嵌入向量以及聚合以区分合法与伪造音频。与现有的深层 ResNet 类解决方案不同,我们在网络中引入了额外的维度——基数(cardinality),以增强 PSA-Net 在多样化攻击下的泛化能力。结果表明,PSA-Net对当前防欺骗解决方案中存在的各种攻击表现出更一致的性能。
引用
@article{arxiv.2411.19841,
title = {Parallel Stacked Aggregated Network for Voice Authentication in IoT-Enabled Smart Devices},
author = {Awais Khan and Ijaz Ul Haq and Khalid Mahmood Malik},
journal= {arXiv preprint arXiv:2411.19841},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2309.10560