Segment Transformer:基于音乐结构分析的人工智能生成音乐检测
声音
2025-09-11 v1 人工智能
音频与语音处理
摘要
音频和音乐生成系统在音乐信息检索 (MIR) 研究领域取得了显著的进展。 这些技术的发展引发了版权 concerns,因为 AI 生成音乐 (AIGM) 的所有权和作者身份尚不明确。 此外,确定音乐是否由 AI 生成或由人类作曲创作仍然困难。 为了解决这些挑战,我们旨在通过分析音乐片段的结构模式来提高 AIGM 检测的准确率。 具体而言,为了从短音频片段中提取音乐特征,我们集成了各种预训练模型,包括自监督学习 (SSL) 模型或音频效果编码器,每种模型都置于我们建议的基于 transformer 的框架中。 此外,针对长音频,我们开发了一个分段 transformer,将音乐划分为多个片段并学习片段之间的关系。 我们使用 FakeMusicCaps 和 SONICS 数据集,在短音频和完整音频检测实验中实现了高准确率。 这些发现表明,将分段级音乐特征集成到长程时间分析中可以有效提升 AIGM 检测系统的性能和鲁棒性。
引用
@article{arxiv.2509.08283,
title = {Segment Transformer: AI-Generated Music Detection via Music Structural Analysis},
author = {Yumin Kim and Seonghyeon Go},
journal= {arXiv preprint arXiv:2509.08283},
year = {2025}
}