面向低资源数据集的音频转录深度学习
机器学习
2018-07-12 v2 机器学习
摘要
在训练深度学习系统执行音频转录时,可能出现两个实际问题。首先,大多数数据集为弱标注,仅具有每个录音中存在的事件列表,而无任何用于训练的时间信息。其次,深度神经网络需要非常大量的标注训练数据以获得良好性能,然而实际上很难为大多数感兴趣的类收集足够样本。在本文中,我们提出将音频转录的最终任务分解为多个中间任务,以在处理此类低资源数据集时改善训练性能。我们评估了训练用于中间任务的堆叠卷积与循环神经网络的三种数据高效方法。我们的结果表明,不同的训练方法具有不同的优势与劣势。
引用
@article{arxiv.1807.03697,
title = {Deep Learning for Audio Transcription on Low-Resource Datasets},
author = {Veronica Morfi and Dan Stowell},
journal= {arXiv preprint arXiv:1807.03697},
year = {2018}
}
备注
20 pages, 5 figures