中文

用于语音增强的带时频注意力多损失卷积网络

声音 2023-06-16 v1 音频与语音处理 机器学习

摘要

双路径卷积循环网络(DPCRN)被提出以有效利用时频域信息。通过将 DPRNN 模块与卷积循环网络(CRN)结合,DPCRN 在以有限模型规模进行语音分离时获得了令人满意的性能。本文中,我们在 DPCRN 模块中探索自注意力,并设计了一个称为带时频注意力的多损失卷积网络(MNTFA)的模型用于语音增强。我们使用自注意力模块来利用长时间信息,其中块内自注意力用于建模频谱模式,块间自注意力用于建模连续帧之间的依赖关系。与 DPRNN 相比,轴向自注意力极大降低了对内存和计算的需求,更适用于语音信号的长序列。此外,我们提出了一种使用预训练 WavLM 网络的多分辨率 STFT 损失与 WavLM 损失的联合训练方法。实验表明,仅用 0.23M 参数,所提模型取得了优于 DPCRN 的性能。

关键词

引用

@article{arxiv.2306.08956,
  title  = {Multi-Loss Convolutional Network with Time-Frequency Attention for Speech Enhancement},
  author = {Liang Wan and Hongqing Liu and Yi Zhou and Jie Ji},
  journal= {arXiv preprint arXiv:2306.08956},
  year   = {2023}
}