中文

用于轻量级语音分离的带上下文编解码器的组通信

音频与语音处理 2021-05-18 v2 人工智能 机器学习 声音

摘要

尽管神经网络架构在语音分离上近期取得进展,模型大小、模型复杂度和模型性能之间的平衡对于此类模型部署到低资源平台仍是一个重要且具挑战的问题。在本文中,我们提出两个简单模块,组通信和上下文编解码器,可轻松应用于广泛架构以在不牺牲性能的前提下共同减小模型大小和复杂度。组通信模块将高维特征拆分为多组低维特征并捕获组间依赖。然后一个模型大小显著减小的分离模块可由所有组共享。上下文编解码器模块包含一个上下文编码器和一个上下文解码器,被设计为可学习的下采样和上采样模块,以减小分离模块处理的序列特征长度。组通信与上下文编解码器模块的组合被称为 GC3 设计。实验结果表明,将 GC3 应用于多种语音分离网络架构,可用小至 2.5% 的模型大小和 17.6% 的模型复杂度实现相当或更好的性能。

关键词

引用

@article{arxiv.2012.07291,
  title  = {Group Communication with Context Codec for Lightweight Source Separation},
  author = {Yi Luo and Cong Han and Nima Mesgarani},
  journal= {arXiv preprint arXiv:2012.07291},
  year   = {2021}
}

备注

IEEE/ACM Transactions on Audio, Speech, and Language Processing (TASLP)