通过层次化推断音节与音素起始位置实现歌声音素分割
声音
2018-06-06 v1 信息检索
音频与语音处理
摘要
在本文中,我们利用与语言无关的信息——起始点与前验粗粒度时长,解决歌唱训练场景下的歌声音素分割问题。我们提出一种两步法。第一步,我们使用卷积神经网络(CNN)联合计算音节与音素起始检测函数(ODFs)。第二步,通过使用时长信息隐马尔可夫模型(HMM)层次化推断音节与音素边界及标签。为实现推断,我们将先验时长模型作为转移概率、将ODFs作为发射概率纳入HMM中。所提方法以与语言无关的方式设计,因此不使用任何音素类别标签。为进行模型训练与算法评估,我们收集了一个新的京剧(亦称北京或平剧)独唱歌声数据集,并人工标注了乐句、音节和音素级别的边界与标签。该数据集已公开。所提方法与基于隐半马尔可夫模型(HSMM)强制对齐的基线方法进行比较。评估结果表明,在分割与起始检测两项任务上,所提方法均大幅优于基线。
引用
@article{arxiv.1806.01665,
title = {Singing voice phoneme segmentation by hierarchically inferring syllable and phoneme onset positions},
author = {Rong Gong and Xavier Serra},
journal= {arXiv preprint arXiv:1806.01665},
year = {2018}
}
备注
Interspeech 2018