中文

基于双模态语义相似性的弱监督音频分离

声音 2024-04-03 v1 人工智能 音频与语音处理

摘要

在没有访问单个源声音数据的条件下进行多源音频混合的条件声音分离是一个长期存在的挑战。现有的基于混合-分离的方法在由于缺乏单个源分离案例的监督信号而导致显著性能下降。然而,在语言条件音频分离情况下,我们可以获得每个音频混合的相应文本描述,这可以看作是音频样本在语言模态中的粗糙表示。为此,我们提出一种通用的双模态分离框架,可增强现有的无监督框架,通过在条件模态(即语言)中易于分离的相应信号,用于分离目标模态(即音频)中的单个源信号,而无需在目标模态中获得单个源样本。我们经验性地表明,如果我们可以获得一个预训练的跨模态嵌入模型(即CLAP),这在实际中完全可行。此外,我们提出将该框架整合到两种基本情形中,以增强分离性能。首先,我们表明我们的方法显著改进了纯无监督基线的性能,通过减少训练和测试样本之间的分布偏移。具体而言,我们表明该框架可实现约66%的信噪比(SDR)提升,达到监督学习性能的97.5%。其次,我们表明我们可以进一步通过提出的弱监督框架提高监督学习性能17%,该方法为音频分离构建了一个强大的半监督框架。

关键词

引用

@article{arxiv.2404.01740,
  title  = {Weakly-supervised Audio Separation via Bi-modal Semantic Similarity},
  author = {Tanvir Mahmud and Saeed Amizadeh and Kazuhito Koishida and Diana Marculescu},
  journal= {arXiv preprint arXiv:2404.01740},
  year   = {2024}
}

备注

Tech report. Accepted in ICLR-2024