利用大规模预训练模型实现免训练的深度伪造语音识别
声音
2024-07-02 v3 计算机视觉与模式识别
音频与语音处理
摘要
泛化性是当前音频深度伪造检测器面临的主要问题,这些检测器难以在分布外数据上提供可靠结果。鉴于越来越精确的合成方法正以极快速度发展,设计出在未经训练的数据上也能良好工作的技术至关重要。本文研究了大规模预训练模型在音频深度伪造检测中的潜力,特别关注其泛化能力。为此,我们将检测问题重新构建在说话人验证框架内,通过测试语音样本与所声称身份的语音之间的不匹配来暴露伪造音频。采用这种范式,训练中无需任何伪造语音样本,从根源上切断了与生成方法的任何联系,从而确保了完全的泛化能力。特征由通用的大规模预训练模型提取,无需在特定的伪造检测或说话人验证数据集上进行训练或微调。在检测时,仅需所测试身份的一组有限语音片段。在社区中广泛使用的多个数据集上的实验表明,基于预训练模型的检测器取得了优异的性能,并展现出强大的泛化能力,在分布内数据上可与监督方法相媲美,在分布外数据上则大幅超越它们。
引用
@article{arxiv.2405.02179,
title = {Training-Free Deepfake Voice Recognition by Leveraging Large-Scale Pre-Trained Models},
author = {Alessandro Pianese and Davide Cozzolino and Giovanni Poggi and Luisa Verdoliva},
journal= {arXiv preprint arXiv:2405.02179},
year = {2024}
}