MUSE:基于 Taylor Transformer 的 U-Net 语音增强多路径感受场与声道融合
声音
2024-09-18 v2 信息检索
信息论
机器学习
音频与语音处理
math.IT
摘要
在轻量化设计与高性能之间取得平衡始终是语音增强面临的挑战。本文引入 Multi-path Enhanced Taylor (MET) Transformer 基于 U-net 的语音增强网络 (MUSE),这是一种轻量化语音增强网络。我们的方案包含一种新型的多路径增强 Taylor (MET) Transformer 块,将可变形嵌入 (Deformable Embedding, DE) 集成其中,以实现语音印记的灵活感受场。MET Transformer 独特地设计用于融合声道注意力 (Channel Attention) 与空间注意力 (Spatial Attention) 分支,促进声道信息交换并解决 Taylor-Transformer 框架中的空间注意力缺失问题。通过在 VoiceBank+DEMAND 数据集上进行大量实验,我们展示了 MUSE 在实现具竞争力性能的同时显著降低了训练与部署成本,仅需 0.51M 参数。
引用
@article{arxiv.2406.04589,
title = {MUSE: Flexible Voiceprint Receptive Fields and Multi-Path Fusion Enhanced Taylor Transformer for U-Net-based Speech Enhancement},
author = {Zizhen Lin and Xiaoting Chen and Junyu Wang},
journal= {arXiv preprint arXiv:2406.04589},
year = {2024}
}
备注
This paper was accepted by Interspeech 2024