当自动语音伪装遇上自动说话人验证
音频与语音处理
2020-09-16 v1 密码学与安全
声音
摘要
为隐藏说话人真实身份而变换声音的技术称为语音伪装,其中利用各类算法修改声音频谱与时域特性、借助公众可获取的软件即可轻易实现的自动语音伪装(AVD)对人工听辨与自动说话人验证(ASV)均构成重大威胁。本文发现,ASV 不仅是 AVD 的受害者,亦可成为击败某些简单类型 AVD 的工具。首先,引入基频缩放、声道长度归一化(VTLN)与语音转换(VC)三类 AVD 作为代表性方法。随后利用最先进的 ASV 方法,通过等错误率(EER)客观评估 AVD 对 ASV 的影响。此外,提出一种通过将关于还原参数的 ASV 得分函数最小化来将伪装语音恢复至原始版本的方法。实验在 Voxceleb(一个真实世界噪声场景下录制的数据集)的伪装语音上进行。结果表明,对于基频缩放式语音伪装,所提方法取得的 EER 约为 7%,而近期提出的基于基频比值的基线方法 EER 为 30%。该方法能很好地推广至恢复 VTLN 中带非线性频率扭曲的伪装,将其 EER 从 34.3% 降至 18.5%。然而,我们的方法难以恢复 VC 中的源说话人,可能需要更复杂的还原函数形式或其他副语言线索来恢复 VC 中的非线性变换。最后,对还原前后 ASV 特征的对比可视化直观地说明了所提方法的作用。
引用
@article{arxiv.2009.06863,
title = {When Automatic Voice Disguise Meets Automatic Speaker Verification},
author = {Linlin Zheng and Jiakang Li and Meng Sun and Xiongwei Zhang and Thomas Fang Zheng},
journal= {arXiv preprint arXiv:2009.06863},
year = {2020}
}
备注
accepted for publication