中文

Deep Autotuner:一种用于卡拉 OK 演唱人声自然音高校正的数据驱动方法

声音 2019-02-05 v1 机器学习 音频与语音处理 机器学习

摘要

我们描述了一种在卡拉 OK 场景下对独唱人声表演进行音高校正的机器学习方法,其中独唱人声与伴奏位于不同音轨。所提方法针对人声与伴奏均无乐谱的情况:它根据人声与伴奏音轨的频谱内容之间的关系预测校正量。因此,模型建议的以音分计的移调量可用于使人声与伴奏听起来音准相符。该方法不同于商用自动音高校正系统——后者将人声音轨中的音符平移至用户定义乐谱中的音符附近,或映射到十二平均律音级中最接近的音高。我们使用一个包含 4702 个因音准良好而被筛选出的业余卡拉 OK 表演的数据集训练模型。我们提出一种卷积门控循环单元(CGRU)模型来完成此任务。该方法可扩展至人声表演的无监督音高校正,即广为人知的 autotuning。

关键词

引用

@article{arxiv.1902.00956,
  title  = {Deep Autotuner: A Data-Driven Approach to Natural-Sounding Pitch Correction for Singing Voice in Karaoke Performances},
  author = {Sanna Wager and George Tzanetakis and Cheng-i Wang and Lijiang Guo and Aswin Sivaraman and Minje Kim},
  journal= {arXiv preprint arXiv:1902.00956},
  year   = {2019}
}