中文

ImagineNET:通过嵌入修复利用间歇视觉线索进行目标说话人提取

音频与语音处理 2023-03-10 v2 声音

摘要

说话人提取技术旨在从语音混合中的干扰声音里分离出目标说话人的声音。通常使用目标说话人的辅助参考来形成主动注意力。预录制的语句或视频片段中同步的唇部运动都可用作辅助参考。视觉线索的使用不仅可行,而且由于其噪声鲁棒性而有效,并日益流行。然而,在真实世界应用中难以保证此类并行视觉线索始终可用,其中可能发生视觉遮挡或间歇通信。在本文中,我们研究具有间歇视觉线索的视听说话人提取算法。我们提出一个联合说话人提取与视觉嵌入修复框架以探索二者的互利。为鼓励两个任务之间的交互,它们以交错结构交替执行并联合优化。我们还提出了两类视觉修复损失,并用两类常用视觉嵌入研究了我们提出的方法。实验结果表明,我们在信号质量、感知质量和可懂度方面优于基线。

关键词

引用

@article{arxiv.2211.00109,
  title  = {ImagineNET: Target Speaker Extraction with Intermittent Visual Cue through Embedding Inpainting},
  author = {Zexu Pan and Wupeng Wang and Marvin Borsdorf and Haizhou Li},
  journal= {arXiv preprint arXiv:2211.00109},
  year   = {2023}
}

备注

Accepted by ICASSP2023