Papez:基于听觉工作记忆的资源高效语音分离
声音
2024-07-02 v1 计算与语言
机器学习
音频与语音处理
摘要
Transformer-based模型最近达到了单通道语音分离的领先准确率;然而,其极大的计算负载使得在资源受限的移动或物联网设备上部署困难。因此,我们提出Papez,一种轻量且计算高效的单通道语音分离模型。Papez基于三个关键技术。我们首先用小型听觉工作记忆取代跨块Transformer。其次,我们自适应修剪不再需要进一步处理的输入标记。最后,我们通过循环Transformer减少参数数量。我们的广泛评估显示,Papez在资源和准确率之间实现了显著的优势。我们公开分享了源代码于\texttt{https://github.com/snuhcs/Papez}
引用
@article{arxiv.2407.00888,
title = {Papez: Resource-Efficient Speech Separation with Auditory Working Memory},
author = {Hyunseok Oh and Juheon Yi and Youngki Lee},
journal= {arXiv preprint arXiv:2407.00888},
year = {2024}
}
备注
5 pages. Accepted by ICASSP 2023