中文

广播场景中的 AI 生成音乐检测

声音 2026-03-04 v2 人工智能 音频与语音处理 信号处理

摘要

AI 音乐生成器已发展到使其输出常常难以区分于人类作品。虽然检测方法已涌现,但通常在干净、完整曲目的数据流媒体情境中进行设计和验证。广播音频则面临不同挑战:音乐作为短片段出现,常被占主导的语音掩盖,在此条件下现有检测器会失败。本文引入 AI-OpenBMAT,这是首个针对广播式 AI 音乐检测设计的数据集。其包含 3,294 个一分钟音频片段(54.9 小时),遵循真实电视音频的时长模式和音量关系,组合人工制作的生产音乐与使用 Suno v3.5 生成的风格匹配的延续作品。我们对 CNN 基线和最新 SpectTTTra 模型进行基准测试,以评估信噪比和时长鲁棒性,并在完整广播情境下进行评估。在所有设置下,在流媒体场景中表现突出的模型都会出现显著退化,当音乐为背景或时长较短时,F1 分数会低于 60%。这些结果凸显语音掩盖和短音乐时长是 AI 音乐检测的关键开放挑战,并将 AI-OpenBMAT 定位为面向工业广播需求开发检测器的基准数据集。

关键词

引用

@article{arxiv.2602.06823,
  title  = {AI-Generated Music Detection in Broadcast Monitoring},
  author = {David López-Ayala and Asier Cabello and Pablo Zinemanas and Emilio Molina and Martín Rocamora},
  journal= {arXiv preprint arXiv:2602.06823},
  year   = {2026}
}

备注

Accepted at ICASSP 2026