中文

Beam-Guided TasNet:一种具有多通道输出的迭代语音分离框架

音频与语音处理 2022-04-13 v6

摘要

时域音频分离网络(TasNet)在盲源分离(BSS)中取得了卓越性能。经典多通道语音处理框架采用信号估计与波束成形。例如,Beam-TasNet 将多通道卷积 TasNet(MC-Conv-TasNet)与最小方差无失真响应(MVDR)波束成形相结合,利用数据驱动网络的强大建模能力,并通过准确估计语音统计量来提升波束成形性能。这种集成可视为一个有向无环图,接受多通道输入并生成多源输出。在本文中,我们设计了一个“多通道输入、多通道多源输出”(MIMMO)的语音分离系统,称为“Beam-Guided TasNet”,其中 MC-Conv-TasNet 与 MVDR 在有向循环流下能够更紧凑地交互并相互促进。具体而言,第一阶段使用 Beam-TasNet 生成估计的单说话人信号,有利于第二阶段的分离。所提框架在波束成形的引导下促进迭代信号细化,并力求达到基于 MVDR 方法的上界。在空间化的 WSJ0-2MIX 上的实验结果表明,Beam-Guided TasNet 取得了 21.5 dB 的 SDR,在相同模型大小下超过基线 Beam-TasNet 4.1 dB,并将与基于 oracle 信号的 MVDR 的差距缩小至 2 dB。

关键词

引用

@article{arxiv.2102.02998,
  title  = {Beam-Guided TasNet: An Iterative Speech Separation Framework with Multi-Channel Output},
  author = {Hangting Chen and Yang Yi and Dang Feng and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2102.02998},
  year   = {2022}
}

备注

Submitted to Inerspeech 2022