中文

LightSAFT: 用于声源分离的轻量级潜在声源感知频率变换

音频与语音处理 2022-01-27 v2 机器学习 声音

摘要

条件声源分离因其灵活性、适用性和可扩展性而备受关注。其性能通常不如现有方法,例如单声源分离模型。然而,最近提出的一种名为 LaSAFT-Net 的方法表明,条件模型可以表现出与现有单声源分离模型相当的性能。本文提出了 LightSAFT-Net,即 LaSAFT-Net 的轻量级版本。作为基线,它在 ISMIR 2021 音乐解混挑战赛期间提供了足够的 SDR 性能以供比较。本文还通过用 TFC-TDF 块替换编码器中的 LightSAFT 块来增强现有的 LightSAFT-Net。我们增强的 LightSAFT-Net 以更少的参数优于前一个版本。条件声源分离因其灵活性、适用性和可扩展性而备受关注。其性能通常不如现有方法,例如单声源分离模型。然而,最近提出的一种名为 LaSAFT-Net 的方法表明,条件模型可以表现出与现有单声源分离模型相当的性能。本文提出了 LightSAFT-Net,即 LaSAFT-Net 的轻量级版本。作为基线,它在 ISMIR 2021 音乐解混挑战赛期间提供了足够的 SDR 性能以供比较。

关键词

引用

@article{arxiv.2111.12516,
  title  = {LightSAFT: Lightweight Latent Source Aware Frequency Transform for Source Separation},
  author = {Yeong-Seok Jeong and Jinsung Kim and Woosung Choi and Jaehwa Chung and Soonyoung Jung},
  journal= {arXiv preprint arXiv:2111.12516},
  year   = {2022}
}

备注

MDX Workshop @ ISMIR 2021, 6 pages, 1 figure