探索音乐根源:应用音频嵌入为生成式音乐模型赋能影响归因
声音
2024-01-29 v1 人工智能
音频与语音处理
摘要
每位艺术家都有一个从前人艺术家及其作品中汲取灵感的创作过程。如今,“灵感”已被生成式音乐模型自动化。这些模型的黑箱特性掩盖了影响其创作输出的作品身份。因此,用户可能会无意中挪用、误用或复制现有艺术家的作品。我们建立了一种可复现的方法,以系统性地识别相似的音频音乐片段,这种方法有助于理解训练数据归因。我们方法的一个关键方面是利用有效的音乐音频相似性度量。我们比较了在用于训练近期开源生成式音乐模型VampNet的500万个音频片段集合中,应用CLMR和CLAP嵌入对相似性度量的影响。我们通过一项人类听觉研究验证了此方法。我们还探讨了对音频样本的修改(例如,音高偏移、时间拉伸、背景噪声)对相似性度量的影响。这项工作是实现将自动化影响归因融入生成式建模的基础,有望让模型创建者和用户从无知的挪用到知情的创作。与本文配套的音频样本可在https://tinyurl.com/exploring-musical-roots获取。
引用
@article{arxiv.2401.14542,
title = {Exploring Musical Roots: Applying Audio Embeddings to Empower Influence Attribution for a Generative Music Model},
author = {Julia Barnett and Hugo Flores Garcia and Bryan Pardo},
journal= {arXiv preprint arXiv:2401.14542},
year = {2024}
}
备注
14 pages + references. Under conference review