中文

双路径滤波网络:用于语音分离的说话人感知建模

音频与语音处理 2022-03-31 v2

摘要

近年来,为应对鸡尾酒会问题,语音分离已被广泛研究。所有相关方法可分为两类:时频域方法与时域方法。此外,一些方法试图生成说话人向量以辅助源分离。本研究中,我们提出一种称为双路径滤波网络(DPFN)的新模型。我们的模型聚焦于语音分离的后处理以提升分离性能。DPFN由两部分组成:说话人模块与分离模块。首先,说话人模块推断说话人身份;随后,分离模块利用说话人信息从混合语音中提取各说话人声音。基于DPRNN-TasNet构建的DPFN不仅优于DPRNN-TasNet,且避免了置换不变训练(PIT)的问题。

关键词

引用

@article{arxiv.2106.07579,
  title  = {Dual-Path Filter Network: Speaker-Aware Modeling for Speech Separation},
  author = {Fan-Lin Wang and Yu-Huai Peng and Hung-Shin Lee and Hsin-Min Wang},
  journal= {arXiv preprint arXiv:2106.07579},
  year   = {2022}
}

备注

Accepted by Interspeech2021