基于深度学习的说话人分离相位重建:三角学视角
声音
2018-11-26 v1 计算与语言
音频与语音处理
摘要
本研究探讨了在短时傅里叶变换 (STFT) 域中基于深度学习的单通道、说话人无关的说话人分离的相位重建问题。关键观察是:对于两个源的混合,在各自幅度被准确估计且处于几何约束下时,每个源与混合信号之间的绝对相位差可被唯一确定;此外,每个时频 (T-F) 单元上的源相位可缩小为仅两个候选值。为挑选正确候选,我们提出了基于迭代相位重建、群延迟估计和相位差符号预测的三种算法。在公开可用的 wsj0-2mix 和 3mix 语料库上取得了最先进的结果。
引用
@article{arxiv.1811.09010,
title = {Deep Learning Based Phase Reconstruction for Speaker Separation: A Trigonometric Perspective},
author = {Zhong-Qiu Wang and Ke Tan and DeLiang Wang},
journal= {arXiv preprint arXiv:1811.09010},
year = {2018}
}
备注
5 pages, in submission to ICASSP-2019