中文

波束成形器引导的目标说话人提取

音频与语音处理 2023-03-16 v1 声音

摘要

我们提出一种波束成形器引导的目标说话人提取(BG-TSE)方法,以根据目标说话人的到达方向从多通道录音中提取其语音。所提方法采用一个朝向目标说话人转向的前端波束成形器,为单通道 TSE 系统提供辅助信号。通过允许单通道 TSE 模块中的时变嵌入,所提方法充分利用了前端波束成形器输出与麦克风信号中目标语音之间的对应关系。在模拟的多通道双说话人混合语音(包括无混响与混响条件)上的实验评估表明了所提方法相对于近期单通道与多通道基线的优势。

关键词

引用

@article{arxiv.2303.08702,
  title  = {Beamformer-Guided Target Speaker Extraction},
  author = {Mohamed Elminshawi and Srikanth Raj Chetupalli and Emanuël A. P. Habets},
  journal= {arXiv preprint arXiv:2303.08702},
  year   = {2023}
}

备注

Submitted to the 2023 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2023)