中文

面向乐谱、音频与歌词的无监督生成对抗对齐表示

音频与语音处理 2020-07-30 v1 信息检索 多媒体 声音

摘要

乐谱、音频与歌词是歌曲创作中的三种主要模态。本文提出一种无监督生成对抗对齐表示(UGAAR)模型,以学习乐谱、歌词与音频这三种主要音乐模态间共享的深度判别表示,其基于三分支的深度神经网络架构进行联合训练。具体而言,该模型通过在潜在共享子空间中学习相关性,将音频与乐谱间的强关联迁移至音频-歌词与乐谱-歌词对。我们采用音频与乐谱的 CCA 分量建立新的真值。生成(G)模型学习两对迁移后配对的相关性,针对给定歌词生成新的音频-乐谱对以挑战判别(D)模型。判别模型旨在区分输入来自生成模型还是真值。两模型以对抗方式同时训练,以增强深度对齐表示学习的能力。实验结果表明我们所提 UGAAR 在乐谱、音频与歌词间对齐表示学习上的可行性。

关键词

引用

@article{arxiv.2007.14856,
  title  = {Unsupervised Generative Adversarial Alignment Representation for Sheet music, Audio and Lyrics},
  author = {Donghuo Zeng and Yi Yu and Keizo Oyama},
  journal= {arXiv preprint arXiv:2007.14856},
  year   = {2020}
}

备注

5 pages, 2 figures, 2 tables