基于异步全循环卷积神经网络的语音分离
声音
2021-12-07 v1 音频与语音处理
摘要
神经网络架构设计的最新进展,特别是那些专门建模序列的架构,已显著提升了语音分离性能。本文中,我们提出使用一种称为全循环卷积神经网络(FRCNN)的仿生架构来解决分离任务。该模型包含自底向上、自顶向下和侧向连接,以融合由不同阶段表示的、在不同时间尺度上处理的信息。与传统并行更新阶段的方法不同,我们提出先自底向上逐阶段更新,再同时融合相邻阶段的信息,最后将所有阶段的信息一并融合至底层阶段。实验表明,该异步更新方案以远少于传统同步更新方案的参数量取得了显著更好的结果。此外,在三个基准数据集上,与其他最先进模型相比,所提模型在语音分离精度与计算效率之间取得了良好平衡。
引用
@article{arxiv.2112.02321,
title = {Speech Separation Using an Asynchronous Fully Recurrent Convolutional Neural Network},
author = {Xiaolin Hu and Kai Li and Weiyi Zhang and Yi Luo and Jean-Marie Lemercier and Timo Gerkmann},
journal= {arXiv preprint arXiv:2112.02321},
year = {2021}
}
备注
Accepted by NeurIPS 2021, Demo at https://cslikai.cn/project/AFRCNN