中文

CtrSVDD:面向受控唱作人声深度伪造检测的基准数据集与基线分析

音频与语音处理 2024-09-25 v2 多媒体 声音

摘要

近期的唱作人声合成与转换技术的发展 necessitates robust singing voice deepfake detection (SVDD) 模型。当前的 SVDD 数据集面临受控性有限、深度伪造方法多样性差以及许可证限制等挑战。为解决这些问题,我们引入 CtrSVDD,一个大规模、多样化的真人与深度伪造唱作人声合集。这些人声是使用可公开获取的唱作人声数据集从最先进的方法中合成的。CtrSVDD 包括 47.64 小时的真人和 260.34 小时的深度伪造唱作人声,涵盖 14 种深度伪造方法,涉及 164 位歌手身份。我们还提出了一个具有灵活前端特征的基线系统,并针对结构化的 train/dev/eval 分割进行评估。实验表明,特征选择的重要性,以及对进一步偏离训练分布的深度伪造方法进行泛化化的必要性。CtrSVDD 数据集和基线方法均可公开获取。

关键词

引用

@article{arxiv.2406.02438,
  title  = {CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection},
  author = {Yongyi Zang and Jiatong Shi and You Zhang and Ryuichi Yamamoto and Jionghao Han and Yuxun Tang and Shengyuan Xu and Wenxiao Zhao and Jing Guo and Tomoki Toda and Zhiyao Duan},
  journal= {arXiv preprint arXiv:2406.02438},
  year   = {2024}
}

备注

Accepted by Interspeech 2024