中文

探索音乐根源:应用音频嵌入为生成式音乐模型赋能影响归因

声音 2024-01-29 v1 人工智能 音频与语音处理

摘要

每位艺术家都有一个从前人艺术家及其作品中汲取灵感的创作过程。如今,“灵感”已被生成式音乐模型自动化。这些模型的黑箱特性掩盖了影响其创作输出的作品身份。因此,用户可能会无意中挪用、误用或复制现有艺术家的作品。我们建立了一种可复现的方法,以系统性地识别相似的音频音乐片段,这种方法有助于理解训练数据归因。我们方法的一个关键方面是利用有效的音乐音频相似性度量。我们比较了在用于训练近期开源生成式音乐模型VampNet的500万个音频片段集合中,应用CLMR和CLAP嵌入对相似性度量的影响。我们通过一项人类听觉研究验证了此方法。我们还探讨了对音频样本的修改(例如,音高偏移、时间拉伸、背景噪声)对相似性度量的影响。这项工作是实现将自动化影响归因融入生成式建模的基础,有望让模型创建者和用户从无知的挪用到知情的创作。与本文配套的音频样本可在https://tinyurl.com/exploring-musical-roots获取。

关键词

引用

@article{arxiv.2401.14542,
  title  = {Exploring Musical Roots: Applying Audio Embeddings to Empower Influence Attribution for a Generative Music Model},
  author = {Julia Barnett and Hugo Flores Garcia and Bryan Pardo},
  journal= {arXiv preprint arXiv:2401.14542},
  year   = {2024}
}

备注

14 pages + references. Under conference review