SingFake:歌声深度伪造检测
声音
2026-02-05 v2 人工智能
音频与语音处理
摘要
歌声合成技术的兴起因未经授权的声音使用给艺术家与行业利益相关者带来严峻挑战。与合成语音不同,合成歌声通常发布于含有强烈背景音乐的歌曲中,可能掩盖合成伪影。此外,歌声相较语音话语具有不同声学与语言特征。这些独特属性使歌声深度伪造检测成为一个相关但显著不同于合成语音检测的问题。本工作中,我们提出歌声深度伪造检测任务。我们首先呈现 SingFake,首个精心收集的野外数据集,包含来自40位歌手、5种语言的28.93小时真实与29.40小时深度伪造歌曲片段。我们提供训练/验证/测试划分,其中测试集涵盖多种场景。随后我们使用 SingFake 评估四个在语音话语上训练的最先进语音对抗系统。我们发现这些系统在歌声测试数据上的表现远落后于其在语音测试数据上的性能。当在 SingFake 上训练时,无论使用分离人声轨或歌曲混音,这些系统均显示出实质性提升。然而,我们的评估也识别出与未见过歌手、通信编解码器、语言及音乐语境相关的挑战,呼吁针对歌声深度伪造检测开展专门研究。SingFake 数据集与相关资源可在 https://www.singfake.org/ 获取。
引用
@article{arxiv.2309.07525,
title = {SingFake: Singing Voice Deepfake Detection},
author = {Yongyi Zang and You Zhang and Mojtaba Heydari and Zhiyao Duan},
journal= {arXiv preprint arXiv:2309.07525},
year = {2026}
}
备注
Accepted at ICASSP 2024