DALI:一个大规模同步音频、歌词与音符数据集,采用师生机器学习范式自动创建
音频与语音处理
2019-06-26 v1 数据库
机器学习
声音
摘要
本文的目标有两个。首先,我们介绍 DALI,一个大规模且丰富的多模态数据集,包含 5358 个音频轨及其在四个粒度层级上时间对齐的人声旋律音符和歌词。第二个目标是阐释我们的方法,其中数据集创建与学习模型通过互为裨益的师生机器学习范式相互作用。我们始于一组由卡拉 OK 游戏非专家用户制作的草稿时间对齐歌词和音符的手动标注。该集合不含音频。因此,我们需要找到对应音频并使标注与之适配。为此,我们从网上检索音频候选。随后使用教师(一个在清洗数据上训练的深度卷积神经网络歌声检测系统(SVD))将每个候选转换为随时间变化的歌声概率。比较时间对齐歌词与歌声概率,我们检测匹配并相应更新时间对齐歌词。由此获得新的音频集合。它们随后被用于训练新的 SVD 学生,以再次执行上述比较。该过程可迭代重复。我们展示这能逐步提升 SVD 性能并获得更好的音频匹配与对齐。
引用
@article{arxiv.1906.10606,
title = {DALI: a large Dataset of synchronized Audio, LyrIcs and notes, automatically created using teacher-student machine learning paradigm},
author = {Gabriel Meseguer-Brocal and Alice Cohen-Hadria and Geoffroy Peeters},
journal= {arXiv preprint arXiv:1906.10606},
year = {2019}
}