中文

Echoes:一个语义对齐的音乐深度伪造检测数据集

声音 2026-03-26 v1 人工智能 音频与语音处理

摘要

我们介绍 Echoes,这是一个新的音乐深度伪造检测数据集,旨在用于训练和基准测试在真实且提供者多样化条件下的检测器。Echoes 包含 3,577 首音轨(共 110 小时音频),涵盖流行、摇滚、电子等多个音乐类型,并包含来自十个流行 AI 音乐生成系统的内容。为防止捷径学习并促进鲁棒性泛化,该数据集刻意设计具有挑战性,强制实现伪造音频与真实参考之间的语义水平对齐。通过对真实波形或歌曲描述符进行条件化来实现此对齐。我们在跨数据集设置下对 Echoes 进行评估,使用 state-of-the-art 的 Wav2Vec2 XLS-R 2B 表示对抗三个现有 AI 生成音乐数据集。结果表明:(i) Echoes 是最难的领域内数据集;(ii) 在 Echoes 上训练的检测器对现有数据集的迁移表现较差;(iii) 在 Echoes 上训练可获得最强的泛化性能。这些发现表明,提供者多样性和语义对齐有助于学习更具迁移性的检测线索。

关键词

引用

@article{arxiv.2603.23667,
  title  = {Echoes: A semantically-aligned music deepfake detection dataset},
  author = {Octavian Pascu and Dan Oneata and Horia Cucu and Nicolas M. Muller},
  journal= {arXiv preprint arXiv:2603.23667},
  year   = {2026}
}