中文

基于 Conv-Tasnet 的端侧低复杂度源分离缩放策略

声音 2023-03-07 v1 机器学习 音频与语音处理

摘要

近来,文献中提出了若干极为有效的单通道语音分离神经方法。然而,由于这些模型的规模与复杂度,其在低资源设备(如助听器和耳机)上的使用仍是挑战,且尚无成熟方案。尽管已有基于剪枝或压缩神经模型的方案,但面向特定应用域的模型架构设计常需启发式流程,不易移植至不同低资源平台。鉴于知名 Conv-Tasnet 语音分离架构的模块化特性,本文考虑直接控制模型总体规模的三个参数,即:残差块数量、分离块重复次数以及深度可分离卷积的通道数,并实验评估它们如何影响语音分离性能。特别地,在 Libri2Mix 上的实验表明,膨胀 1D-Conv 块数量是最关键参数,且在残差块中使用额外膨胀可减小性能下降。

关键词

引用

@article{arxiv.2303.03005,
  title  = {Scaling strategies for on-device low-complexity source separation with Conv-Tasnet},
  author = {Mohamed Nabih Ali and Francesco Paissan and Daniele Falavigna and Alessio Brutti},
  journal= {arXiv preprint arXiv:2303.03005},
  year   = {2023}
}