中文

Fusion Segment Transformer:用于AI生成音乐检测的双向注意力引导融合网络

声音 2026-01-21 v1 人工智能

摘要

随着生成式 AI 技术的兴起,如今任何人都能轻松创作并发布 AI 生成音乐,这加剧了对解决版权与所有权问题的技术方案的需求。现有工作主要聚焦于短音频,而需要建模长程结构与上下文的全音频检测挑战仍探索不足。为此,我们提出了一种改进版的 Segment Transformer,称为 Fusion Segment Transformer。与我们之前的工作一样,我们使用多种特征提取器从短音乐片段中提取内容嵌入。此外,我们通过引入门控融合层(Gated Fusion Layer)来增强用于全音频 AI 生成音乐检测的架构,该层有效整合了内容与结构信息,从而能够捕捉长程上下文。在 SONICS 和 AIME 数据集上的实验表明,我们的方法优于先前的模型和近期的基线方法,在 AI 生成音乐检测中取得了 SOTA 结果。

关键词

引用

@article{arxiv.2601.13647,
  title  = {Fusion Segment Transformer: Bi-Directional Attention Guided Fusion Network for AI-Generated Music Detection},
  author = {Yumin Kim and Seonghyeon Go},
  journal= {arXiv preprint arXiv:2601.13647},
  year   = {2026}
}