中文

SATB合唱录音中多基频建模框架

声音 2019-04-11 v1 机器学习 多媒体 音频与语音处理

摘要

基频(f0)建模是合唱演唱中一个重要但相对未被充分探索的方面。无论单独还是合唱,演唱的性能评估与听觉分析通常依赖于提取人声的f0轮廓。然而,由于大量歌手在相近频率范围内演唱,从合唱录音中提取精确的个体音高轮廓是一项具有挑战性的任务。本文中,我们解决该任务并开发了用于SATB合唱录音音高轮廓建模的方法。典型的SATB合唱由四个声部组成,每个声部覆盖不同的音高范围且通常各有若干歌手。我们首先针对每声部仅一名歌手的合唱特例评估了一些最先进的多f0估计系统,并观察到个体歌手的音高可被相对高精度地估计。然而,我们观察到每个合唱声部有多名歌手(即齐唱)的情形更具挑战性。本工作中,我们提出了一种基于深度学习的多f0估计方法与传统DSP技术相结合的方法论,以对每个合唱声部建模f0及其离散度,而非单一f0轨迹。我们展示并讨论了我们的观察,并用不同歌手配置测试了我们的框架。

关键词

引用

@article{arxiv.1904.05086,
  title  = {A Framework for Multi-f0 Modeling in SATB Choir Recordings},
  author = {Helena Cuesta and Emilia Gómez and Pritish Chandna},
  journal= {arXiv preprint arXiv:1904.05086},
  year   = {2019}
}