中文

基于黑盒成员推断的生成式音乐模型训练数据审计

机器学习 2026-05-29 v1

摘要

近期文本到音乐生成技术的进展使得高保真合成结构化音乐音频成为可能,引发日益担忧的数据来源、知情同意及训练透明度问题。此类模型通常在大规模语料上训练,披露不足,缺乏实用机制验证特定音频样本是否包含在训练数据中。本文研究针对生成式音乐模型的黑盒成员推断,以确定给定候选音频样本是否用于训练,仅凭对部署系统的查询访问权限即可实现。我们的关键洞察是:训练成员会导致候选样本与模型在其标题条件下生成的输出之间呈现系统性更强的语义和结构对齐。我们通过与关联标题查询目标模型,并在学习的特征空间中衡量候选音频与生成输出之间的关系。为捕捉区分成员与非成员的特征,我们构建由每个音轨及其标题条件生成输出组成的配对示例,并训练音乐审计员以进行成员分类。该审计员捕捉训练成员特征的对齐模式,并在完全黑盒环境下对未见目标模型进行泛化(无需访问模型参数或训练元数据)。在多个最先进音乐生成器上,我们的方法实现率最高可达98.6%,误报率和漏报率分别低于1.9%和1.0%,证明在真实部署场景中可实现可靠的训练数据审计。

关键词

引用

@article{arxiv.2605.29202,
  title  = {Auditing Training Data in Generative Music Models via Black-Box Membership Inference},
  author = {Yi Chen Liu and Jiawei Yu and Kexin Cao and Syed Irfan Ali Meerza and Trishika Movva and Jian Liu},
  journal= {arXiv preprint arXiv:2605.29202},
  year   = {2026}
}

备注

The paper has been accepted for presentation at the workshop ArtSec 2026: Workshop on Artwork Security and Provenance in the Age of AI