时间变异性与多视角自监督表示应对 ASVspoof5 深度伪造挑战
声音
2024-08-14 v1 人工智能
音频与语音处理
摘要
ASVspoof5 是 ASVspoof 系列的第五届,是全球规模最大的音频安全挑战之一,旨在推动反制措施 (CM) 的发展,以区分真实语音和伪造语音。本文聚焦于解决开放域音频深度伪造检测问题,该问题直接对应 ASVspoof5 Track1 开放条件。首先,我们全面研究了 ASVspoof5 上的各种反制措施,包括数据扩展、数据增强和自监督学习 (SSL) 特征。由于 ASVspoof5 数据集的高频间隙特征,我们引入了频率掩蔽 (Frequency Mask),一种通过掩蔽特定频段来提升 CM 鲁棒性的数据增强方法。结合多种时间尺度的信息与多组 SSL 特征,我们的实验在 ASVspoof5 Track1 评估集上取得了 minDCF 为 0.0158、EER 为 0.55% 的结果。
引用
@article{arxiv.2408.06922,
title = {Temporal Variability and Multi-Viewed Self-Supervised Representations to Tackle the ASVspoof5 Deepfake Challenge},
author = {Yuankun Xie and Xiaopeng Wang and Zhiyong Wang and Ruibo Fu and Zhengqi Wen and Haonan Cheng and Long Ye},
journal= {arXiv preprint arXiv:2408.06922},
year = {2024}
}