中文

面向目标语音提取的场景感知视听TF-GridNet

音频与语音处理 2023-10-31 v1 多媒体

摘要

目标语音提取旨在基于给定的条件线索,从被干扰源(如噪声或竞争说话人)损坏的信号中提取目标语音信号。基于最先进的(SOTA)时频说话人分离模型TF-GridNet的成果,我们提出了AV-GridNet,一种以视觉为基础的变体,在提取过程中将目标说话人的人脸记录作为条件因素。认识到作为干扰源的语言与噪声信号之间固有的差异性,我们还提出了SAV-GridNet,一种场景感知模型,其首先识别干扰场景的类型,然后应用专门针对该场景训练的专用专家模型。我们所提出的模型在第二届COG-MHEAR视听语音增强挑战赛上取得了SOTA结果,在客观指标和听测中均以显著优势优于其他模型。我们还对两种场景下的结果进行了广泛分析。

关键词

引用

@article{arxiv.2310.19644,
  title  = {Scenario-Aware Audio-Visual TF-GridNet for Target Speech Extraction},
  author = {Zexu Pan and Gordon Wichern and Yoshiki Masuyama and Francois G. Germain and Sameer Khurana and Chiori Hori and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2310.19644},
  year   = {2023}
}

备注

Accepted by ASRU 2023