SONICS:人工歌曲合成检测
声音
2025-02-26 v4 人工智能
计算机视觉与模式识别
机器学习
音频与语音处理
摘要
AI生成歌曲的近期激增为可能性和挑战提供了 exciting 机遇。这些创新需要能够区分人类创作的歌曲与合成歌曲,以保护艺术完整性并维护人类音乐艺术。现有研究和数据集只关注歌声深度伪造检测(SVDD),其中人声是AI生成的,但乐器来自真实歌曲。然而,这些方法不足以检测当今端到端人工歌曲,其中所有组件(人声、音乐、歌词和风格)都可能是AI生成的。此外,现有数据集缺乏音乐-歌词多样性、长时长歌曲以及开放获取的人工歌曲。为解决这些问题,我们引入SONICS,用于端到端人工歌曲检测(SSD)的新型数据集,包含超过97k首歌曲(4,751小时),其中49k首来自Suno和Udio等热门平台的人工歌曲。此外,我们强调在歌曲中建模长程时间依赖性对于有效身份验证的重要性,这一方面在现有方法中完全被忽略了。为利用长期模式,我们引入SpecTTTra,一种新型体系结构,显著改进了传统CNN和Transformer-based模型的时间和内存效率。在长歌曲方面,我们的最佳变体相较于ViT在F1分数上提升8%,速度提升38%,内存使用减少26%,同时也超过ConvNeXt,F1分数提升1%,速度提升20%,内存减少67%。
关键词
引用
@article{arxiv.2408.14080,
title = {SONICS: Synthetic Or Not -- Identifying Counterfeit Songs},
author = {Md Awsafur Rahman and Zaber Ibn Abdul Hakim and Najibul Haque Sarker and Bishmoy Paul and Shaikh Anowarul Fattah},
journal= {arXiv preprint arXiv:2408.14080},
year = {2025}
}
备注
Accepted to ICLR 2025. Project url: https://github.com/awsaf49/sonics