中文

双关语:基于多视角融合的鲁棒性音频AI生成歌词检测

计算与语言 2025-07-01 v2 人工智能 声音 音频与语音处理

摘要

基于AI的音乐生成工具的快速发展正在革新音乐产业,但也给艺术家、版权持有者和平台提供商带来了挑战。这需要可靠的方法来检测此类AI生成的内容。然而,现有的检测器要么依赖音频,要么依赖歌词,都存在关键的实际局限性:基于音频的检测器无法泛化到新的或未见过的生成器,并且容易受到音频扰动的影响;基于歌词的方法需要格式干净且准确的歌词,这在实践中无法获得。为了克服这些局限性,我们提出了一种新颖的、基于实际的方法:一个多模态、模块化的后期融合流水线,该流水线结合了自动转录的演唱歌词和捕获音频中歌词相关信息的语音特征。通过直接依赖音频中的歌词方面,我们的方法增强了鲁棒性,减轻了对低级伪影的敏感性,并实现了实际适用性。实验表明,我们的方法DE-detect优于现有的基于歌词的检测器,同时对音频扰动也更具鲁棒性。因此,它为在现实场景中检测AI生成的音乐提供了一种有效、鲁棒的解决方案。我们的代码可在https://github.com/deezer/robust-AI-lyrics-detection获取。

关键词

引用

@article{arxiv.2506.15981,
  title  = {Double Entendre: Robust Audio-Based AI-Generated Lyrics Detection via Multi-View Fusion},
  author = {Markus Frohmann and Gabriel Meseguer-Brocal and Markus Schedl and Elena V. Epure},
  journal= {arXiv preprint arXiv:2506.15981},
  year   = {2025}
}

备注

Accepted to ACL 2025 Findings