中文

MUSE:基于 Taylor Transformer 的 U-Net 语音增强多路径感受场与声道融合

声音 2024-09-18 v2 信息检索 信息论 机器学习 音频与语音处理 math.IT

摘要

在轻量化设计与高性能之间取得平衡始终是语音增强面临的挑战。本文引入 Multi-path Enhanced Taylor (MET) Transformer 基于 U-net 的语音增强网络 (MUSE),这是一种轻量化语音增强网络。我们的方案包含一种新型的多路径增强 Taylor (MET) Transformer 块,将可变形嵌入 (Deformable Embedding, DE) 集成其中,以实现语音印记的灵活感受场。MET Transformer 独特地设计用于融合声道注意力 (Channel Attention) 与空间注意力 (Spatial Attention) 分支,促进声道信息交换并解决 Taylor-Transformer 框架中的空间注意力缺失问题。通过在 VoiceBank+DEMAND 数据集上进行大量实验,我们展示了 MUSE 在实现具竞争力性能的同时显著降低了训练与部署成本,仅需 0.51M 参数。

关键词

引用

@article{arxiv.2406.04589,
  title  = {MUSE: Flexible Voiceprint Receptive Fields and Multi-Path Fusion Enhanced Taylor Transformer for U-Net-based Speech Enhancement},
  author = {Zizhen Lin and Xiaoting Chen and Junyu Wang},
  journal= {arXiv preprint arXiv:2406.04589},
  year   = {2024}
}

备注

This paper was accepted by Interspeech 2024