中文

通过层次化推断音节与音素起始位置实现歌声音素分割

声音 2018-06-06 v1 信息检索 音频与语音处理

摘要

在本文中,我们利用与语言无关的信息——起始点与前验粗粒度时长,解决歌唱训练场景下的歌声音素分割问题。我们提出一种两步法。第一步,我们使用卷积神经网络(CNN)联合计算音节与音素起始检测函数(ODFs)。第二步,通过使用时长信息隐马尔可夫模型(HMM)层次化推断音节与音素边界及标签。为实现推断,我们将先验时长模型作为转移概率、将ODFs作为发射概率纳入HMM中。所提方法以与语言无关的方式设计,因此不使用任何音素类别标签。为进行模型训练与算法评估,我们收集了一个新的京剧(亦称北京或平剧)独唱歌声数据集,并人工标注了乐句、音节和音素级别的边界与标签。该数据集已公开。所提方法与基于隐半马尔可夫模型(HSMM)强制对齐的基线方法进行比较。评估结果表明,在分割与起始检测两项任务上,所提方法均大幅优于基线。

关键词

引用

@article{arxiv.1806.01665,
  title  = {Singing voice phoneme segmentation by hierarchically inferring syllable and phoneme onset positions},
  author = {Rong Gong and Xavier Serra},
  journal= {arXiv preprint arXiv:1806.01665},
  year   = {2018}
}

备注

Interspeech 2018