中文

MusicTM-Dataset:用于乐谱、歌词与音乐音频联合表示学习的数据集

声音 2021-05-10 v2 数据库 信息检索 多媒体 音频与语音处理

摘要

本工作提出一个名为 MusicTM-Dataset 的音乐数据集,用于提升不同类型跨模态检索(CMR)的表示学习能力。现有包含三种模态的大型音乐数据集很少可用于 CMR 的表示学习。为收集音乐数据集,我们扩展原始音乐记号为合成音频并生成乐谱图像,构建基于音乐记号的乐谱图像、音频片段和音节标注文本作为细粒度对齐,从而可利用 MusicTM-Dataset 获得多模态数据点的共享表示。MusicTM-Dataset 呈现 3 种模态,包括乐谱图像、歌词文本和合成音频,其表示由一些先进模型提取。本文中,我们介绍音乐数据集的背景并说明数据收集过程。基于我们的数据集,我们实现了 CMR 任务的一些基本方法。MusicTM-Dataset 可在 https://github.com/dddzeng/MusicTM-Dataset 获取。

关键词

引用

@article{arxiv.2012.00290,
  title  = {MusicTM-Dataset for Joint Representation Learning among Sheet Music, Lyrics, and Musical Audio},
  author = {Donghuo Zeng and Yi Yu and Keizo Oyama},
  journal= {arXiv preprint arXiv:2012.00290},
  year   = {2021}
}

备注

12 pages, 5 figures, 2 tables