双路径滤波网络:用于语音分离的说话人感知建模
音频与语音处理
2022-03-31 v2
摘要
近年来,为应对鸡尾酒会问题,语音分离已被广泛研究。所有相关方法可分为两类:时频域方法与时域方法。此外,一些方法试图生成说话人向量以辅助源分离。本研究中,我们提出一种称为双路径滤波网络(DPFN)的新模型。我们的模型聚焦于语音分离的后处理以提升分离性能。DPFN由两部分组成:说话人模块与分离模块。首先,说话人模块推断说话人身份;随后,分离模块利用说话人信息从混合语音中提取各说话人声音。基于DPRNN-TasNet构建的DPFN不仅优于DPRNN-TasNet,且避免了置换不变训练(PIT)的问题。
引用
@article{arxiv.2106.07579,
title = {Dual-Path Filter Network: Speaker-Aware Modeling for Speech Separation},
author = {Fan-Lin Wang and Yu-Huai Peng and Hung-Shin Lee and Hsin-Min Wang},
journal= {arXiv preprint arXiv:2106.07579},
year = {2022}
}
备注
Accepted by Interspeech2021