中文

Papez:基于听觉工作记忆的资源高效语音分离

声音 2024-07-02 v1 计算与语言 机器学习 音频与语音处理

摘要

Transformer-based模型最近达到了单通道语音分离的领先准确率;然而,其极大的计算负载使得在资源受限的移动或物联网设备上部署困难。因此,我们提出Papez,一种轻量且计算高效的单通道语音分离模型。Papez基于三个关键技术。我们首先用小型听觉工作记忆取代跨块Transformer。其次,我们自适应修剪不再需要进一步处理的输入标记。最后,我们通过循环Transformer减少参数数量。我们的广泛评估显示,Papez在资源和准确率之间实现了显著的优势。我们公开分享了源代码于\texttt{https://github.com/snuhcs/Papez}

关键词

引用

@article{arxiv.2407.00888,
  title  = {Papez: Resource-Efficient Speech Separation with Auditory Working Memory},
  author = {Hyunseok Oh and Juheon Yi and Youngki Lee},
  journal= {arXiv preprint arXiv:2407.00888},
  year   = {2024}
}

备注

5 pages. Accepted by ICASSP 2023