中文

基于生成对抗网络与Transformer的音乐生成

声音 2023-10-11 v4

摘要

基于Transformer的自回归模型已成为生成具有完整音乐结构乐曲的主流方法。这些模型通常以自回归方式通过最小化观测序列的负对数似然(NLL)进行训练。然而,在生成长序列时,由于暴露偏差,这些模型所生成样本的质量往往会显著下降。为解决此问题,我们利用训练用于区分真实序列与采样序列的分类器来识别这些失败情况。这一观察促使我们探索将对抗损失作为NLL目标的补充。我们在生成对抗网络(GAN)框架中采用预训练的Span-BERT模型作为判别器,这在我们的实验中增强了训练稳定性。为在GAN框架内优化离散序列,我们利用Gumbel-Softmax技巧获得采样过程的可微近似。此外,我们将序列划分为较小块以满足内存约束。通过人工评估并引入一种新颖的判别性度量,我们证明了我们的方法优于仅基于似然最大化的基线模型。

关键词

引用

@article{arxiv.2309.09075,
  title  = {Music Generation based on Generative Adversarial Networks with Transformer},
  author = {Ziyi Jiang and Ruoxue Wu and Zhenghan Chen and Xiaoxuan Liang},
  journal= {arXiv preprint arXiv:2309.09075},
  year   = {2023}
}

备注

arXiv admin note: This version has been removed by arXiv administrators due to copyright infringement