时域语音身份变形 (TD-VIM):面向说话人验证系统的信号级变形方法
声音
2026-04-08 v1
摘要
在生物识别系统中,通常将每个样本或模板与特定个体关联。然而,近期研究表明,可以生成能够匹配多个身份的“变形”生物识别样本。这些变形攻击被认作是生物识别系统的潜在安全风险。然而,大多数关于变形攻击的研究集中于 operates within 图像域内的生物识别模态,如人脸、指纹和虹膜。本文介绍了时域语音身份变形 (Time-domain Voice Identity Morphing, TD-VIM),这是一种用于语音生物识别变形的新方法。该方法 enables 在信号层面融合来自两个不同身份的语音特征,创建出对说话人验证系统具有高危险性的变形样本。基于 Multilingual Audio-Visual Smartphone 数据库,我们的研究根据变形因素创建了四个不同的变形信号,并进行了全面的脆弱性分析。为了评估 TD-VIM 的安全影响,我们使用广义变形攻击潜力 (Generalized Morphing Attack Potential, G-MAP) 指标对其进行基准测试,测试对象为两个基于深度学习的说话人验证系统 (SVS) 和一个商业系统 Verispeak。我们的发现表明,变形语音样本实现了高攻击成功率,在 iPhone-11 上达到 99.40% G-MAP 值,在 Samsung S8 上达到 99.74%,在文本依赖场景下,假匹配率为 0.1%。
引用
@article{arxiv.2604.05683,
title = {Time-Domain Voice Identity Morphing (TD-VIM): A Signal-Level Approach to Morphing Attacks on Speaker Verification Systems},
author = {Aravinda Reddy PN and Raghavendra Ramachandra and K. Sreenivasa Rao and Pabitra Mitra and Kunal Singh},
journal= {arXiv preprint arXiv:2604.05683},
year = {2026}
}