基于多视图特征的鲁棒音频深度伪造检测系统
声音
2024-03-05 v1 音频与语音处理
摘要
随着生成式建模技术的进步,合成人类语音与真实语音越来越难以区分,给音频深度伪造检测(ADD)系统带来了棘手的挑战。在本文中,我们利用音频特征来提高 ADD 系统的泛化能力。在广泛的音频特征范围内对 ADD 任务性能进行了研究,包括各种手工特征和基于学习的特征。实验表明,在大量数据上预训练的基于学习的音频特征在域外场景下比手工特征具有更好的泛化能力。随后,我们使用提出的多特征方法进一步提高了 ADD 系统的泛化能力,以融合来自不同视图特征的互补信息。在 ASV2019 数据上训练的模型在 In-the-Wild 数据集上实现了 24.27\% 的等错误率。
引用
@article{arxiv.2403.01960,
title = {A robust audio deepfake detection system via multi-view feature},
author = {Yujie Yang and Haochen Qin and Hang Zhou and Chengcheng Wang and Tianyu Guo and Kai Han and Yunhe Wang},
journal= {arXiv preprint arXiv:2403.01960},
year = {2024}
}
备注
5 pages, 2 figures