中文

基于卷积神经网络的人声重唱组合多基频估计

音频与语音处理 2020-09-10 v1 机器学习 声音

摘要

本文利用卷积神经网络(CNNs)解决从复调及无伴奏人声演唱中提取多个基频(F0)值的问题。我们针对重唱演唱的主要挑战,即所有旋律声源均为人声且歌手以和声方式演唱。我们基于一种现有架构生成输入信号的音高显著函数,其中采用谐波常数Q变换(HCQT)及其相关相位差分作为输入表示。随后对该音高显著函数进行阈值处理以获得多F0估计输出。在训练方面,我们构建了一个包含多个带F0标注的人声四重唱多轨数据集。本工作在多种场景与数据配置(包括带有额外混响的录音)下提出并评估了一组用于该任务的CNNs。当以更高的F0分辨率进行评估时,我们的模型优于针对同一音乐体裁的现有最优(SOTA)方法,以及一种通用的多F0估计方法。最后我们讨论了未来的研究方向。

关键词

引用

@article{arxiv.2009.04172,
  title  = {Multiple F0 Estimation in Vocal Ensembles using Convolutional Neural Networks},
  author = {Helena Cuesta and Brian McFee and Emilia Gómez},
  journal= {arXiv preprint arXiv:2009.04172},
  year   = {2020}
}

备注

Accepted to the 21st International Society for Music Information Retrieval (ISMIR) Conference (2020)