中文

结合音素与时长信息的音频到乐谱匹配

声音 2017-07-13 v1

摘要

我们通过使用音素和时长信息来处理歌唱乐句音频到乐谱匹配问题——重点研究京剧无伴奏歌唱案例。我们认为,由于京剧音乐中每种模式存在基本旋律轮廓,仅使用旋律信息(如音高轮廓)将导致模糊匹配。这促使我们提出一种基于音素和时长信息的匹配方法。音素信息通过用我们的数据塑造的声学模型提取,时长信息通过我们研究的隐马尔可夫模型(HMMs)变体来考虑。我们为乐谱中的每个歌词路径构建一个模型,并通过排序解码的最可能状态序列的后验概率来实现匹配。研究了三种声学模型:(i)卷积神经网络(CNNs)、(ii)深度神经网络(DNNs)和(iii)高斯混合模型(GMMs)。此外,比较了两种时长模型:(i)隐半马尔可夫模型(HSMM)和(ii)后处理器时长模型。结果表明,在我们的(小)音频数据集上CNNs表现更好,且HSMM优于后处理器时长模型。

关键词

引用

@article{arxiv.1707.03547,
  title  = {Audio to score matching by combining phonetic and duration information},
  author = {Rong Gong and Jordi Pons and Xavier Serra},
  journal= {arXiv preprint arXiv:1707.03547},
  year   = {2017}
}