中文

一种用于流行音乐人声平滑音高修正的数据驱动方法

声音 2018-05-08 v1 音频与语音处理

摘要

在本文中,我们提出了一种用于卡拉OK场景下人声音高修正的机器学习方法,其中人声与伴奏位于分离的音轨且时间对齐。该网络以两条音轨的时频表示为输入,预测使人声与伴奏听感协调所需的以音分(cents)为单位的音高偏移量。它在半专业演唱样本上进行训练。所提方法与现有实时音高修正方法的区别在于:不再通过音高跟踪并映射到离散音集(例如,十二平均律的十二个音级),而是直接从人声与伴奏音轨的谐波中学习在频率和时间上均连续的修正量。循环神经网络(RNN)模型提供的修正考虑了上下文,保留了富有表现力的音高弯曲与颤音。该方法可扩展至人声演唱的无监督音高修正——即广为人知的自动调音(autotuning)。

关键词

引用

@article{arxiv.1805.02603,
  title  = {A Data-Driven Approach to Smooth Pitch Correction for Singing Voice in Pop Music},
  author = {Sanna Wager and Lijiang Guo and Aswin Sivaraman and Minje Kim},
  journal= {arXiv preprint arXiv:1805.02603},
  year   = {2018}
}