用神经网络驱动的过渡-持续模型建模歌唱基频
音频与语音处理
2018-03-13 v1 声音
摘要
本研究聚焦于从中音轨类记谱法存储的乐谱生成歌唱声音的基频(F0)曲线。当前用于歌唱 F0 建模的统计参数方法由于统计模型的过平滑倾向,难以复现颤音以及音符边界处的时间细节。本文提出一种基于神经网络的解决方案:每次对一对相邻音符建模(过渡模型),并使用一个独立网络生成颤音(持续模型)。两模型的预测在经过适当包络处理后通过求和合并以强制连续性。在训练阶段,乐谱与目标 F0 之间的轻微错位通过将梯度反向传播至网络输入来应对。在 NITech 歌唱数据库上的主观听测表明,过渡-持续模型能够生成接近于原始演唱的 F0 轨迹。
引用
@article{arxiv.1803.04030,
title = {Modeling Singing F0 With Neural Network Driven Transition-Sustain Models},
author = {Kanru Hua},
journal= {arXiv preprint arXiv:1803.04030},
year = {2018}
}
备注
5 pages, 5 figures