用于提升复调器乐中歌声检测的迁移学习
音频与语音处理
2020-08-12 v1 声音
摘要
在复调器乐中检测歌声对音乐信息检索至关重要。为训练鲁棒的歌声检测器,带有帧级人声或非人声标记的大规模数据集必不可少。然而,帧级标注耗时费力,导致可用于歌声检测(S-VD)的良标数据集稀少。为此,我们提出一种通过迁移学习进行S-VD的数据增强方法。本研究中,带语音活动端点的干净语音片段与分离的器乐片段被人工叠加,以模拟复调人声来训练人声/非人声检测器。由于说话与歌唱在发音和发声上的差异,用人工数据集训练的人声检测器与歌唱人声伴以器乐伴奏的复调音乐匹配不佳。为减小此失配,采用迁移学习将人工语音加音乐训练集上学到的知识迁移至小规模但匹配的复调数据集,即带伴奏的歌唱人声。通过将相关知识迁移以弥补S-VD中良标训练数据的缺乏,所提基于迁移学习的数据增强方法可将S-VD性能F值从89.5%提升至93.2%。
引用
@article{arxiv.2008.04658,
title = {Transfer Learning for Improving Singing-voice Detection in Polyphonic Instrumental Music},
author = {Yuanbo Hou and Frank K. Soong and Jian Luan and Shengchen Li},
journal= {arXiv preprint arXiv:2008.04658},
year = {2020}
}
备注
Accepted by INTERSPEECH 2020