面向语音深度伪造检测与野外 SASV 的 SpoofCeleb 数据集
声音
2025-04-16 v2 人工智能
音频与语音处理
摘要
本文介绍了 SpoofCeleb 数据集,旨在用于语音深度伪造检测(SDD)和防欺骗的自动说话人验证(SASV),该数据集利用来自真实世界条件的源数据,并生成由文本转语音(TTS)系统生成的欺骗攻击,这些 TTS 系统也在相同的真实世界数据上进行训练。鲁健的识别系统需要训练语音数据在不同声学环境中进行,具有不同的噪声水平。然而,当前数据集通常包括干净、高质量的录音(真实数据),由于 TTS 训练的要求;通常需要采用工作室质量或录音良好的阅读语音来训练 TTS 模型。当前的 SDD 数据集也由于说话人多样性不足,对训练 SASV 模型具有有限的实用性。SpoofCeleb 利用我们开发的完全自动化管道处理 VoxCeleb1 数据集,将其转换为适合 TTS 训练的形式。随后我们训练了 23 个当代 TTS 系统。SpoofCeleb 包含来自 1,251 个独特说话人的 250 万多个语音utterance,收集于自然真实世界条件下。该数据集包括经过严格划分的训练、验证和评估数据集,并附有受控的实验协议。我们提供了针对 SDD 和 SASV 任务的基线结果。所有数据、协议和基线方法均公开于 https://jungjee.github.io/spoofceleb。
引用
@article{arxiv.2409.17285,
title = {SpoofCeleb: Speech Deepfake Detection and SASV In The Wild},
author = {Jee-weon Jung and Yihan Wu and Xin Wang and Ji-Hoon Kim and Soumi Maiti and Yuta Matsunaga and Hye-jin Shim and Jinchuan Tian and Nicholas Evans and Joon Son Chung and Wangyou Zhang and Seyun Um and Shinnosuke Takamichi and Shinji Watanabe},
journal= {arXiv preprint arXiv:2409.17285},
year = {2025}
}
备注
IEEE OJSP. Official document lives at: https://ieeexplore.ieee.org/stamp/stamp.jsp?arnumber=10839331