中文

基于深度学习的说话人分离相位重建:三角学视角

声音 2018-11-26 v1 计算与语言 音频与语音处理

摘要

本研究探讨了在短时傅里叶变换 (STFT) 域中基于深度学习的单通道、说话人无关的说话人分离的相位重建问题。关键观察是:对于两个源的混合,在各自幅度被准确估计且处于几何约束下时,每个源与混合信号之间的绝对相位差可被唯一确定;此外,每个时频 (T-F) 单元上的源相位可缩小为仅两个候选值。为挑选正确候选,我们提出了基于迭代相位重建、群延迟估计和相位差符号预测的三种算法。在公开可用的 wsj0-2mix 和 3mix 语料库上取得了最先进的结果。

关键词

引用

@article{arxiv.1811.09010,
  title  = {Deep Learning Based Phase Reconstruction for Speaker Separation: A Trigonometric Perspective},
  author = {Zhong-Qiu Wang and Ke Tan and DeLiang Wang},
  journal= {arXiv preprint arXiv:1811.09010},
  year   = {2018}
}

备注

5 pages, in submission to ICASSP-2019