Fusion Segment Transformer:用于AI生成音乐检测的双向注意力引导融合网络
声音
2026-01-21 v1 人工智能
摘要
随着生成式 AI 技术的兴起,如今任何人都能轻松创作并发布 AI 生成音乐,这加剧了对解决版权与所有权问题的技术方案的需求。现有工作主要聚焦于短音频,而需要建模长程结构与上下文的全音频检测挑战仍探索不足。为此,我们提出了一种改进版的 Segment Transformer,称为 Fusion Segment Transformer。与我们之前的工作一样,我们使用多种特征提取器从短音乐片段中提取内容嵌入。此外,我们通过引入门控融合层(Gated Fusion Layer)来增强用于全音频 AI 生成音乐检测的架构,该层有效整合了内容与结构信息,从而能够捕捉长程上下文。在 SONICS 和 AIME 数据集上的实验表明,我们的方法优于先前的模型和近期的基线方法,在 AI 生成音乐检测中取得了 SOTA 结果。
引用
@article{arxiv.2601.13647,
title = {Fusion Segment Transformer: Bi-Directional Attention Guided Fusion Network for AI-Generated Music Detection},
author = {Yumin Kim and Seonghyeon Go},
journal= {arXiv preprint arXiv:2601.13647},
year = {2026}
}