中文

神经目标语音提取:综述

音频与语音处理 2023-05-17 v1 声音

摘要

人类即使在具有噪声、混响和干扰说话者的挑战性声学条件下也能聆听目标说话者。这一现象被称为鸡尾酒会效应。数十年来,研究人员一直致力于接近人类的聆听能力。一个关键问题是处理干扰说话者,因为目标与非目标语音信号具有相似特征,使它们的区分复杂化。目标语音/说话者提取(TSE)利用识别混合物中说话者的线索,从多个说话者(有或没有噪声和混响)的混合物中分离出目标说话者的语音信号。此类线索可能是指示目标说话者方向的空间线索、说话者嘴唇的视频或可以推导出其声音特征的预录制注册语句。TSE 是一个新兴的研究领域,近年来受到越来越多的关注,因为它提供了鸡尾酒会问题的实用方法,并涉及音频、视觉、阵列处理和深度学习等信号处理方面。本文关注近期的基于神经的方法,并对 TSE 进行深入的概述。我们引导读者了解不同的主要方法,强调框架之间的相似性并讨论潜在的未来方向。

关键词

引用

@article{arxiv.2301.13341,
  title  = {Neural Target Speech Extraction: An Overview},
  author = {Katerina Zmolikova and Marc Delcroix and Tsubasa Ochiai and Keisuke Kinoshita and Jan Černocký and Dong Yu},
  journal= {arXiv preprint arXiv:2301.13341},
  year   = {2023}
}

备注

Submitted to IEEE Signal Processing Magazine on Apr. 25, 2022, and accepted on Jan. 12, 2023