自动说话人验证系统欺骗攻击中人与机器生成语音的检测与评估
声音
2020-11-26 v2 音频与语音处理
摘要
自动说话人验证(ASV)系统利用人类语音中的生物特征信息来验证说话人身份。用于执行说话人验证的技术常易受恶意攻击,此类攻击试图诱导ASV系统返回错误结果,使冒名者绕过系统并获取访问权限。攻击者为此使用多种欺骗技术,如语音转换、音频重放、语音合成等。近年来,易于获取的深度学习伪造(deepfaked)音频生成工具增加了对ASV系统的潜在威胁。本文中,我们在黑盒与白盒ASV系统上比较基于人类模仿(语音伪装)的攻击与基于机器生成语音的攻击之潜力。我们还基于机器无法模拟人类语音产生机制中诸多精细层面的独特性之假设,利用捕捉人类语音产生独特方面的特征来研究对策。我们表明基频序列相关熵、谱包络与非周期参数是检测未知方法生成的深度学习伪造语音的可靠候选特征。
引用
@article{arxiv.2011.03689,
title = {Detection and Evaluation of human and machine generated speech in spoofing attacks on automatic speaker verification systems},
author = {Yang Gao and Jiachen Lian and Bhiksha Raj and Rita Singh},
journal= {arXiv preprint arXiv:2011.03689},
year = {2020}
}
备注
6 pages excluding references. Paper accepted by IEEE Spoken Language Technology (SLT) 2021