中文

ArtifactNet:基于 Forensic Residual Physics 检测 AI 生成音乐

声音 2026-04-21 v2 音频与语音处理

摘要

我们提出 ArtifactNet,一个轻量级框架,将 AI 生成音乐检测问题重新定义为 Forensic 物理问题——从神经音频编解码器不可避免地烙印在生成音频上的物理性残留物中提取并分析。该方法采用受限掩码 UNet(ArtifactUNet,参数 360 万)从频谱图中提取编解码器残留物,再通过 HPSS 分解为 7 通道 Forensic 特征用于分类,后者由紧凑 CNN(参数 40 万,总计 400 万)完成分类。我们引入 ArtifactBench,一个包含 6183 条音轨(其中 4383 条来自 22 个生成器的 AI 音乐,1800 条来自 6 个多样化来源的真实音乐)的多生成器评估基准。每条音轨均标注 bench_origin 以实现公平的零样本评估。在未见测试分区(n=2263)上,ArtifactNet 实现 F1=0.9829,FPR=1.49%,相较于 CLAM(F1=0.7576,FPR=69.26%)和 SpecTTTra(F1=0.7713,FPR=19.43%)在相同条件下使用公开检查点评估。编解码器感知训练(4 路 WAV/MP3/AAC/Opus 数据增强)进一步将跨编解码器概率漂移降低 83%(Delta 从 0.95 降至 0.16),解决了主要的编解码器不变性失效模式。这些结果表明,Forensic 物理——直接提取编解码器级别的残留物——比表示学习方法更通用、参数更高效,是检测 AI 音乐的通用范式,参数数量仅为 CLAM 的 49 倍,约为 SpecTTTra 的 4.8 倍。

关键词

引用

@article{arxiv.2604.16254,
  title  = {ArtifactNet: Detecting AI-Generated Music via Forensic Residual Physics},
  author = {Heewon Oh},
  journal= {arXiv preprint arXiv:2604.16254},
  year   = {2026}
}

备注

v2: Added SONICS 3-way (n=23,288), OOD taxonomy, benchmark coverage table, baseline reproduction appendix; toned-down claims; reframed discussion as asymmetric defender advantage. 8 pages, 6 figs, 12 tables