中文

基于学习的借助空间相干性的鲁棒说话人计数与分离

音频与语音处理 2023-08-08 v2

摘要

提出了一种用于噪声和混响环境下说话人计数与语音分离的三阶段方法。在空间特征提取中,使用跨时间帧的白化相对传递函数(wRTF)计算空间相干矩阵(SCM)。每个说话人的全局活跃函数由使用 SCM 特征向量构成的单形估计,而局部相干函数由时间-频率单元的 wRTF 与目标说话人的全局活跃函数加权的 RTF 之间的相干性计算。在说话人计数中,我们使用 SCM 的特征值以及两个说话人之间帧间全局活跃分布的最大相似度作为说话人计数网络(SCnet)的输入特征。在说话人分离中,使用全局与局部活跃驱动网络(GLADnet)提取每个独立的说话人信号,这对高度重叠的语音信号尤其有用。在真实会议录音上获得的实验结果表明,所提系统无需阵列配置的先验知识即可取得优于以往文献的说话人计数与分离性能。

关键词

引用

@article{arxiv.2303.06867,
  title  = {Learning-based Robust Speaker Counting and Separation with the Aid of Spatial Coherence},
  author = {Yicheng Hsu and Mingsian Bai},
  journal= {arXiv preprint arXiv:2303.06867},
  year   = {2023}
}

备注

20 pages, 17 figures