V2S 攻击:从自动说话人验证构建基于 DNN 的语音转换
声音
2019-08-06 v1 密码学与安全
机器学习
音频与语音处理
摘要
本文提出了一种利用语音转换(VC)的新型语音仿冒攻击。为自动说话人验证(ASV)注册个人语音可提供自然且灵活的生物特征认证系统。基本上,ASV 系统不包含用户的语音数据。然而,若 ASV 系统意外暴露并被恶意攻击者入侵,则存在攻击者使用 VC 技术复现已注册用户语音的风险。我们将此命名为“验证到合成(V2S)攻击”,并提出利用 ASV 与预训练自动语音识别(ASR)模型、且无需目标说话人语音数据的 VC 训练方法。该 VC 模型通过欺骗 ASV 模型来复现目标说话人的个性特征,并通过匹配 ASR 模型预测的音素后验图来恢复输入语音的音素属性。实验评估比较了所提不使用目标说话人语音数据的方法与使用该数据的标准 VC 之间的转换语音。实验结果表明,所提方法的性能可与使用极少量平行语音数据训练的现有 VC 方法相媲美。
引用
@article{arxiv.1908.01454,
title = {V2S attack: building DNN-based voice conversion from automatic speaker verification},
author = {Taiki Nakamura and Yuki Saito and Shinnosuke Takamichi and Yusuke Ijima and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:1908.01454},
year = {2019}
}
备注
5 pages, 2 figures, accepted for The 10th ISCA Speech Synthesis Workshop (SSW10)