中文

面向音频源分离的语义分组网络

声音 2024-07-08 v1 计算机视觉与模式识别 机器学习 多媒体 音频与语音处理

摘要

最近的音频-视觉分离方法利用两种模态之间的天然同步性,以提升音频源分离性能。它们从视觉输入中提取高层语义信息,作为引导信号以帮助分离单个声源的表征。我们可以直接从声音本身学习来 disentangle 各个声源的语义吗?面临的困境是,多个声源在原始空间中被混合。为克服这一难题,本文提出一种新型语义分组网络,称为SGN,能够直接 disentangle 声音表征,并从输入音频混合信号中为每个声源提取高层语义信息。具体而言,SGN通过对声源类别特征进行聚合,利用可学习的类别标记(token)。随后,提取的语义特征可作为引导信号,用于从混合信号中分离对应的音频源。我们在仅包含音乐的基准数据集(MUSIC)、通用声音分离基准(FUSS)、MUSDB18以及VGG-Sound上进行了广泛实验。结果表明,SGN显著优于以往的音频-only方法和不依赖额外视觉线索的音频-视觉模型。

关键词

引用

@article{arxiv.2407.03736,
  title  = {Semantic Grouping Network for Audio Source Separation},
  author = {Shentong Mo and Yapeng Tian},
  journal= {arXiv preprint arXiv:2407.03736},
  year   = {2024}
}