中文

一种用于语言模型音乐生成的独立性促进损失

声音 2024-06-11 v2 人工智能 机器学习 音频与语音处理

摘要

使用语言建模的音乐生成方案依赖于音频标记的词汇表,这些标记通常由自编码器学习的离散潜在空间中的码提供。多级量化器通常用于产生这些标记,因此用于标记预测的解码策略必须适应多个码本:要么对所有码本的联合分布进行建模,要么拟合码本边缘分布的乘积。对联合分布建模需要自回归步骤数量的大幅增加,而拟合边缘分布的乘积会产生不精确的模型,除非码本相互独立。在这项工作中,我们引入了一种独立性促进损失来正则化用作音乐生成语言模型中分词器的自编码器。所提出的损失是基于最大均值差异原理的互信息代理,应用于可再生核希尔伯特空间。我们的准则易于实现和训练,并且可推广到其他多流编解码器。我们表明,它减少了自编码过程中码本之间的统计依赖性。这导致在建模边缘分布乘积时生成的音乐质量提高,同时生成音频的速度比联合分布模型快得多。

关键词

引用

@article{arxiv.2406.02315,
  title  = {An Independence-promoting Loss for Music Generation with Language Models},
  author = {Jean-Marie Lemercier and Simon Rouard and Jade Copet and Yossi Adi and Alexandre Défossez},
  journal= {arXiv preprint arXiv:2406.02315},
  year   = {2024}
}

备注

Accepted to ICML 2024