中文

通过多头注意力学习跨通道特征以改进双麦克风语音增强

音频与语音处理 2022-05-04 v1 声音

摘要

人工设计的空间特征,如通道间强度差(IID)与通道间相位差(IPD),在近期基于深度学习的双麦克风语音增强(DMSE)系统中起着基础性作用。然而,在端到端 DMSE 中难以学习人工设计的空间特征与频谱特征之间的相互关系。本工作提出一种使用基于多头交叉注意力的卷积循环网络(MHCA-CRN)的 DMSE 新架构。所提 MHCA-CRN 模型包含用于保留通道内特征的逐通道编码结构,以及用于充分挖掘跨通道特征的多头交叉注意力机制。此外,该方法在多任务学习框架下专门构建带额外 SNR 估计器的解码器,以估计帧级 SNR,期望避免端到端 DMSE 模块导致的语音失真。最后,采用频谱增益函数进一步抑制不自然的残留噪声。实验结果表明,所提模型相对于若干 SOTA 模型具有更优性能。

关键词

引用

@article{arxiv.2205.01280,
  title  = {Improving Dual-Microphone Speech Enhancement by Learning Cross-Channel Features with Multi-Head Attention},
  author = {Xinmeng Xu and Rongzhi Gu and Yuexian Zou},
  journal= {arXiv preprint arXiv:2205.01280},
  year   = {2022}
}

备注

Accepted by ICASSP 2022