中文

RelUNet:基于相对通道融合的多通道语音增强U-Net

声音 2024-10-08 v1 机器学习 音频与语音处理

摘要

神经网络多通道语音增强模型,特别是基于U-Net架构的模型,显示出良好的性能和泛化潜力。这些模型通常独立编码输入通道,并在网络后期阶段整合通道。本文提出一种新的模型修改方法,通过堆叠在整体上融合相对信息。具体而言,每个通道与参考通道一起处理,这种输入策略利用比较差异来自适应地融合通道间的信息,从而捕获关键的空间信息并提升整体性能。在CHiME-3数据集上进行的实验表明,各种架构的语音增强指标均得到改善。

关键词

引用

@article{arxiv.2410.05019,
  title  = {RelUNet: Relative Channel Fusion U-Net for Multichannel Speech Enhancement},
  author = {Ibrahim Aldarmaki and Thamar Solorio and Bhiksha Raj and Hanan Aldarmaki},
  journal= {arXiv preprint arXiv:2410.05019},
  year   = {2024}
}