逻辑接入语音呈现攻击检测实用指南
音频与语音处理
2022-01-11 v1 密码学与安全
声音
摘要
带有自动说话人验证(ASV)组件的基于语音的人机界面已在市场上普遍使用。然而,呈现攻击的威胁也在增长,因为攻击者可以利用近期的语音合成技术生成听起来自然的受害者语音。因此,ASV 的呈现攻击检测(PAD),或称语音反欺骗,是不可或缺的。自 2010 年代初以来,语音 PAD 研究取得了显著进展,包括 PAD 模型、基准数据集和评估活动的进步。本章介绍了语音 PAD 领域的实用指南,重点关注使用文本转语音与语音转换算法的逻辑接入攻击,以及基于伪迹检测的反欺骗对策。它介绍了语音 PAD 的基本概念,解释了常用技术,并给出了在基准数据集上使用近期方法的实验研究。实验代码已开源。
引用
@article{arxiv.2201.03321,
title = {A Practical Guide to Logical Access Voice Presentation Attack Detection},
author = {Xin Wang and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2201.03321},
year = {2022}
}
备注
This work will appear as one chapter for a new book called Frontiers in Fake Media Generation and Detection, edited by Mahdi Khosravy, Isao Echizen, Noboru Babaguchi. The code for this chapter is available in https://github.com/nii-yamagishilab/project-NN-Pytorch-scripts