鸡尾酒叉问题:面向真实世界音轨的三分支音频分离
音频与语音处理
2022-03-25 v2 声音
摘要
鸡尾酒会问题旨在从复杂声学场景中隔离出任意感兴趣的信号源,长期以来一直启发着音频源分离研究。近期的努力主要集中于将语音从噪声中分离、语音从语音中分离、乐器彼此分离,或声音事件彼此分离。然而,尽管存在广泛的应用前景,将一个音频混合体(例如电影音轨)分离为语音、音乐和音效(理解为包含环境噪声与自然声音事件)这三大宽泛类别,在很大程度上仍未被探索。本文将该任务形式化为鸡尾酒叉问题,并提出了 Divide and Remaster (DnR) 数据集以推动该主题的研究。DnR 由三个成熟的音频数据集(LibriSpeech、FMA、FSD50k)构建而成,注重在源重叠与相对响度方面重现类似于专业制作内容的条件,并以 CD 音质提供。我们在 DnR 上对标准源分离算法进行了基准测试,并进一步引入了一种新的多分辨率模型,以更好地应对三类信号源声学特性的多样性。我们的最佳模型相对于混合体在 SI-SDR 上取得的改进为:音乐 11.0 dB、语音 11.2 dB、音效 10.8 dB。
引用
@article{arxiv.2110.09958,
title = {The Cocktail Fork Problem: Three-Stem Audio Separation for Real-World Soundtracks},
author = {Darius Petermann and Gordon Wichern and Zhong-Qiu Wang and Jonathan Le Roux},
journal= {arXiv preprint arXiv:2110.09958},
year = {2022}
}
备注
Accepted to ICASSP2022. For resources and examples, see https://cocktail-fork.github.io