中文

用于歌声检测的知识蒸馏

声音 2021-08-23 v2 计算与语言 机器学习 音频与语音处理

摘要

歌声检测(SVD)一直是音乐信息检索(MIR)中的活跃研究领域。目前,文献中存在两种基于深度神经网络的方法,一种基于 CNN,另一种基于 RNN,它们为语音检测(VD)任务学习优化特征,并在常用数据集上达到最先进的性能。这两个模型都具有大量参数(CNN 为 1.4M,RNN 为 65.7K),因此不适合部署在内存和计算能力有限的智能手机或嵌入式传感器等设备上。在深度学习文献中,解决此问题的最流行方法称为知识蒸馏(除模型压缩外),即使用一个称为教师的大型预训练网络来训练较小的学生网络。鉴于 SVD 在音乐信息检索中的广泛应用,据我们所知,用于实际部署的模型压缩尚未被探索。在本文中,我们尝试使用常规以及集成知识蒸馏技术来研究这一问题。

关键词

引用

@article{arxiv.2011.04297,
  title  = {Knowledge Distillation for Singing Voice Detection},
  author = {Soumava Paul and Gurunath Reddy M and K Sreenivasa Rao and Partha Pratim Das},
  journal= {arXiv preprint arXiv:2011.04297},
  year   = {2021}
}

备注

Accepted at INTERSPEECH 2021. 5 pages, 3 figures