MSTRE-Net:用于自动歌词转写的多种流声学建模
声音
2021-08-06 v1 计算与语言
信息检索
音频与语音处理
摘要
本文对自动歌词转写 (ALT) 研究作出若干贡献。主要贡献是一种多流时间延迟神经网络 (MTDNN) 架构的新变体,称为 MSTRE-Net,它以多种不同分辨率的并行流处理时间信息,使网络更紧凑,从而比使用相同 TDNN 流具有更快的推理速度与更高的识别率。此外,提出在训练声学模型前的两个新预处理步骤。首先,我们建议在训练声学模型时使用来自单声道与多声道领域的录音。其次,我们用不同标签标记单声道与多声道录音,以在对齐时区分非人声静音与音乐片段。而且,我们提出一个比 ALT 文献中现有数据集规模显著更大、音乐多样性更高且保持歌手性别平衡的新测试集。我们性能最佳的模型大幅刷新了歌词转写的 SOTA。为可复现,我们公开分享了用于检索本文数据的标识符。
引用
@article{arxiv.2108.02625,
title = {MSTRE-Net: Multistreaming Acoustic Modeling for Automatic Lyrics Transcription},
author = {Emir Demirel and Sven Ahlbäck and Simon Dixon},
journal= {arXiv preprint arXiv:2108.02625},
year = {2021}
}