中文

Sandglasset:一种用于时域语音分离的轻量多粒度自注意力网络

音频与语音处理 2021-03-09 v2 人工智能 机器学习 声音 信号处理

摘要

领先的单通道语音分离(SS)模型之一基于带有双路径分割技术的 TasNet,其中每个片段的大小在所有层中保持不变。相反,我们的核心发现是多粒度特征对于增强上下文建模与计算效率至关重要。我们提出了一种具有新颖沙漏形结构的自注意力网络,即 Sandglasset,它以显著更小的模型规模与计算成本推进了当前最优(SOTA)的 SS 性能。在 Sandglasset 的每个块内前向传播时,特征的时间粒度逐渐变粗直至到达网络块的一半,随后向原始信号层级依次变细。我们还揭示,相同粒度特征间的残差连接对于信息经过瓶颈层后的保留至关重要。实验表明,我们仅含 2.3M 参数的 Sandglasset 在两个基准 SS 数据集——WSJ0-2mix 与 WSJ0-3mix 上取得了最佳结果,相较于先前 SOTA 结果,SI-SNRi 分数分别绝对提升了 0.8 dB 与 2.4 dB。

关键词

引用

@article{arxiv.2103.00819,
  title  = {Sandglasset: A Light Multi-Granularity Self-attentive Network For Time-Domain Speech Separation},
  author = {Max W. Y. Lam and Jun Wang and Dan Su and Dong Yu},
  journal= {arXiv preprint arXiv:2103.00819},
  year   = {2021}
}

备注

Accepted in ICASSP 2021