中文

面向音频编解码器的语音分离技术探索

声音 2024-07-08 v2 机器学习 音频与语音处理

摘要

最近的神经音频编解码器(NAC)模型取得了显著进展,引发对在多种语音处理应用中采用预训练编解码器以实现高压缩效率的兴趣,但这些技术尚未被用于语音分离(SS)任务。SS可从高压缩比中受益,因为传统SS模型对计算资源要求高,难以在许多边缘计算场景中实际应用。然而,SS是一种波形掩码任务,压缩容易引入噪声,严重影响性能。为此,我们提出了音频编解码器驱动的SS新任务,并提出了一种新模型Codecformer来解决该问题。在推理阶段,Codecformer实现了MAC减少52倍,同时保持与云端部署的Sepformer相当的分离性能。该方法为在实际场景中高效执行SS指明了新方向。

关键词

引用

@article{arxiv.2406.12434,
  title  = {Towards Audio Codec-based Speech Separation},
  author = {Jia Qi Yip and Shengkui Zhao and Dianwen Ng and Eng Siong Chng and Bin Ma},
  journal= {arXiv preprint arXiv:2406.12434},
  year   = {2024}
}

备注

This paper was accepted by Interspeech 2024