中文

Fake Speech Wild:检测社交媒体平台上的深度伪造语音

声音 2025-08-15 v1 人工智能

摘要

语音生成技术的快速发展导致深度伪造语音在社交媒体平台上广泛传播。虽然深度伪造音频对策(CMs)在公开数据集上取得了令人期待的结果,但在跨域场景中性能会显著下降。为推进面向实际场景的深度伪造检测,我们首先提出了 Fake Speech Wild(FSW)数据集,包含来自四个不同媒体平台、聚焦于社交媒体的 254 小时的真实与深度伪造音频。作为 CMs,我们建立了一个基准,使用公开数据集和先进的自监督学习(SSL)基于的 CMs 来评估当前 CMs 在实际场景中的表现。我们还评估了数据增强策略在增强 CM 对社交媒体上深度伪造语音检测鲁棒性方面的效果。最后,通过增强公开数据集并纳入 FSW 训练集,我们显著提升了实际场景下的深度伪造音频检测性能,在所有评估集合中的平均等错误率(EER)达到 3.54%。

关键词

引用

@article{arxiv.2508.10559,
  title  = {Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform},
  author = {Yuankun Xie and Ruibo Fu and Xiaopeng Wang and Zhiyong Wang and Ya Li and Zhengqi Wen and Haonnan Cheng and Long Ye},
  journal= {arXiv preprint arXiv:2508.10559},
  year   = {2025}
}