Deep Autotuner:一种用于卡拉 OK 演唱人声自然音高校正的数据驱动方法
声音
2019-02-05 v1 机器学习
音频与语音处理
机器学习
摘要
我们描述了一种在卡拉 OK 场景下对独唱人声表演进行音高校正的机器学习方法,其中独唱人声与伴奏位于不同音轨。所提方法针对人声与伴奏均无乐谱的情况:它根据人声与伴奏音轨的频谱内容之间的关系预测校正量。因此,模型建议的以音分计的移调量可用于使人声与伴奏听起来音准相符。该方法不同于商用自动音高校正系统——后者将人声音轨中的音符平移至用户定义乐谱中的音符附近,或映射到十二平均律音级中最接近的音高。我们使用一个包含 4702 个因音准良好而被筛选出的业余卡拉 OK 表演的数据集训练模型。我们提出一种卷积门控循环单元(CGRU)模型来完成此任务。该方法可扩展至人声表演的无监督音高校正,即广为人知的 autotuning。
引用
@article{arxiv.1902.00956,
title = {Deep Autotuner: A Data-Driven Approach to Natural-Sounding Pitch Correction for Singing Voice in Karaoke Performances},
author = {Sanna Wager and George Tzanetakis and Cheng-i Wang and Lijiang Guo and Aswin Sivaraman and Minje Kim},
journal= {arXiv preprint arXiv:1902.00956},
year = {2019}
}