中文

计算与内存高效的通用声源分离

声音 2022-02-01 v2 计算与语言 机器学习 音频与语音处理

摘要

近年来由深度学习引领的音频源分离进展已使许多神经网络模型为该基本估计问题提供鲁棒解。在本研究中,我们提供一系列高效的神经网络架构用于通用音频源分离,同时关注阻碍神经网络在真实场景中应用的多个计算方面。该卷积网络的骨干结构为SUccessive DOwnsampling and Resampling of Multi-Resolution Features(SuDoRM-RF,多分辨率特征连续下采样与上采样)及其通过简单一维卷积进行的聚合。该机制使我们的模型在存在可变数量声源且计算资源有限(如浮点运算、内存占用、参数数量和延迟)的广泛设置中获得高保真信号分离。我们的实验表明,SuDoRM-RF模型性能可比拟甚至超越多个具有显著更高计算资源需求的state-of-the-art基准。SuDoRM-RF的因果变体能够在约10dB尺度不变信号失真比改善(SI-SDRi)的实时语音分离中获得竞争性性能,同时在笔记本电脑设备上保持比实时快至多20倍。

关键词

引用

@article{arxiv.2103.02644,
  title  = {Compute and memory efficient universal sound source separation},
  author = {Efthymios Tzinis and Zhepei Wang and Xilin Jiang and Paris Smaragdis},
  journal= {arXiv preprint arXiv:2103.02644},
  year   = {2022}
}

备注

Accepted to Journal of Signal Processing Systems https://www.springer.com/journal/11265. arXiv admin note: substantial text overlap with arXiv:2007.06833