中文

基于深度学习的源分离应用于合唱团合奏

音频与语音处理 2020-08-19 v1 机器学习 声音

摘要

合唱是一种广泛实践的合奏演唱形式,其中一组人同时以复调和声演唱。合唱团最常见的配置由四个声部组成:女高音、女中音、男高音和男低音(SATB),每个声部有其自身的基频(F00s)范围。该合唱配置的源分离任务旨在将 SATB 混合音频分离为各组成声部。音乐混合的源分离已被充分研究,许多基于深度学习的方法已被提出。然而,多数研究聚焦于典型情形,即从混合中分离人声、打击乐和低音源,每种源具有截然不同的频谱结构。相比之下,合奏演唱的同时性与和声性导致合唱混合中各个源的频谱成分高度结构相似且重叠,使得合唱源分离比典型情形更困难。这一点,加上缺乏合适的整合数据集,导致该领域研究匮乏。本文中,我们首先评估一些近期发展的音乐源分离方法在 SATB 合唱上的表现。随后我们提出一种新颖的域特定适配,利用各演唱组的基频轮廓来调节近期提出的用于音乐源分离的 U-Net 架构,并证明我们所提方法超越了域无关架构的结果。

关键词

引用

@article{arxiv.2008.07645,
  title  = {Deep Learning Based Source Separation Applied To Choir Ensembles},
  author = {Darius Petermann and Pritish Chandna and Helena Cuesta and Jordi Bonada and Emilia Gomez},
  journal= {arXiv preprint arXiv:2008.07645},
  year   = {2020}
}

备注

To appear at the 21st International Society for Music Information Retrieval Conference, Montr\'eal, Canada, 2020, audio examples available at: "https://darius522.github.io/satb-source-separation-results/"