中文

重新思考语音分离网络中的分离层

音频与语音处理 2020-11-18 v1 声音

摘要

现有所有语音分离网络中的模块可分为单输入多输出(SIMO)模块与单输入单输出(SISO)模块。SIMO模块产生的输出多于输入,SISO模块保持输入输出数量相同。尽管大多数分离模型仅含SIMO架构,但已有研究表明,某些集成后增强SISO模块的两阶段分离系统可改善分离质量。为何引入SISO模块能提升性能?SIMO模块是否始终必要?本文通过设计在SIMO与SISO模块上具有不同配置的模型,对这些问题进行实证考察。我们表明,与标准仅SIMO设计相比,同等模型尺寸下的混合SIMO-SISO设计能够提升分离性能,尤其在低重叠条件下。我们进一步验证了SIMO模块的必要性,并表明仅SISO模型仍能在不牺牲性能的情况下进行分离。这些观察使我们重新思考模型设计范式,并就分离如何完成提供了不同视角。

关键词

引用

@article{arxiv.2011.08400,
  title  = {Rethinking the Separation Layers in Speech Separation Networks},
  author = {Yi Luo and Zhuo Chen and Cong Han and Chenda Li and Tianyan Zhou and Nima Mesgarani},
  journal= {arXiv preprint arXiv:2011.08400},
  year   = {2020}
}