通过遗忘方法为大规模音乐生成模型进行训练数据归因
声音
2025-10-08 v2 音频与语音处理
摘要
本文探讨了使用遗忘方法对大规模数据集上训练的音乐生成模型进行训练数据归因(TDA)。TDA旨在识别特定模型生成特定输出时最有贡献的具体训练数据点。在AI生成音乐的语境中,由于对原作家的正确认可和赞誉通常被忽视,这一问题尤为关键。通过实现白箱归因,本工作支持更公平的艺术贡献认可系统,并解决了与AI伦理和版权相关的紧迫问题。我们将遗忘方法应用于大规模数据集上训练的文本到音乐扩散模型,并探讨其在该领域的可行性和行为特征。为验证该方法,我们对不同的超参数配置进行网格搜索,对遗忘方法的一致性进行量化评估。随后,我们将遗忘归因模式与非反事实方法进行比较。我们的发现表明,遗忘方法可以有效地应用于音乐生成模型,使大规模TDA引入该领域,为音乐创作的更具伦理性和可解释性的AI系统铺平了道路。
引用
@article{arxiv.2506.18312,
title = {Large-Scale Training Data Attribution for Music Generative Models via Unlearning},
author = {Woosung Choi and Junghyun Koo and Kin Wai Cheuk and Joan Serrà and Marco A. Martínez-Ramírez and Yukara Ikemiya and Naoki Murata and Yuhta Takida and Wei-Hsiang Liao and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2506.18312},
year = {2025}
}
备注
accepted at NeurIPS 2025 Creative AI Track