中文

用于SingFake检测的歌声图建模

音频与语音处理 2025-06-04 v2 声音 信号处理

摘要

检测歌声深度伪造(SingFake)涉及确定歌声的真实性和版权。现有的语音深度伪造检测模型难以适应人类发声这一独特歌声领域中的未见攻击。为弥补这一差距,我们提出了一种开创性的SingGraph模型。该模型协同了MERT声学音乐理解模型用于音高和节奏分析的能力,以及wav2vec2.0模型用于歌词的语言分析。此外,我们提倡使用基于音乐领域知识的RawBoost和节拍匹配技术进行歌声增强,从而提升SingFake检测性能。我们提出的方法在SingFake数据集上取得了新的最先进(SOTA)结果,在三种不同场景下超越了之前的SOTA模型:对于见过歌手的EER相对提高了13.2%,对于未见歌手提高了24.3%,对于使用不同编解码器的未见歌手提高了37.1%。

关键词

引用

@article{arxiv.2406.03111,
  title  = {Singing Voice Graph Modeling for SingFake Detection},
  author = {Xuanjun Chen and Haibin Wu and Jyh-Shing Roger Jang and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2406.03111},
  year   = {2025}
}

备注

Accepted by Interspeech 2024; Our code is available at https://github.com/xjchenGit/SingGraph.git